欢迎您访问《智慧农业(中英文)》官方网站! English

基于改进YOLOv10s的番茄成熟度及外观缺陷检测模型

  • 李彦梅 ,
  • 颜猛 ,
  • 汪雨 ,
  • 杭琪 ,
  • 汪胜
展开
  • 安庆师范大学智能制造与机器人学院,安徽 安庆 246000,中国
李彦梅,硕士,教授,研究方向为智能控制与流量检测、机器学习。E-mail:

收稿日期: 2026-05-06

  网络出版日期: 2026-07-17

基金资助

国家自然科学基金项目(12204013)

Improved YOLOv10s-Based Model for Tomato Ripeness and Surface Defect Detection

  • LI Yanmei ,
  • YAN Meng ,
  • WANG Yu ,
  • HANG Qi ,
  • WANG Sheng
Expand
  • School of Intelligent Manufacturing and Robotics, Anqing Normal University, Anqing 246000, China
LI Yanmei, E-mail:

Received date: 2026-05-06

  Online published: 2026-07-17

Supported by

National Natural Science Foundation of China(12204013)

Copyright

copyright©2026 by the authors

摘要

【目的/意义】 番茄成熟度的精细化分级与外观缺陷的精准识别是决定其市场定位与流通安全的关键环节,为解决现有番茄检测算法成熟度分级粒度不足、外观缺陷一体化识别缺失、检测精度与部署效率难以平衡的问题,匹配产业通用的四级成熟度采收标准,满足自动化采收与智能分拣的高精度、轻量化作业需求,本文提出一种改进的 YOLOv10s 番茄检测模型 ——Tomato-YOLO。 【方法】 该模型以YOLOv10s为基线框架,首先引入尺度感知上下文模块替换骨干网络中的C2f模块,强化对相邻成熟度细微差异特征的捕获能力;其次构建跨层级多尺度特征融合策略并拓展为四检测头架构,新增面向超小目标的P2检测层以增强复杂田间环境下的目标感知鲁棒性;采用形状交并比损失函数替代完全交并比损失函数损失并设计小目标自适应加权策略以优化边界框回归精度;最后引入层自适应幅度剪枝技术对冗余卷积层进行结构化裁剪。 【结果和讨论】 Tomato-YOLO模型的精确率、召回率及平均精度均值分别达到92.1%、92.0%与95.0%,较原始YOLOv10s模型分别提升6.9、11.6及6.8个百分点;经15%比例剪枝部署于Jetson Nano边缘计算平台后,模型权重压缩至15.1 MB,推理速度达30.4帧/s。 【结论】 Tomato-YOLO模型实现了番茄成熟度细粒度分级与外观缺陷一体化识别的高精度与高实时性统一,可为番茄产业智能化采收与分拣提供有效的视觉检测技术支持。

本文引用格式

李彦梅 , 颜猛 , 汪雨 , 杭琪 , 汪胜 . 基于改进YOLOv10s的番茄成熟度及外观缺陷检测模型[J]. 智慧农业, 2026 : 1 -12 . DOI: 10.12133/j.smartag.SA202605006

Abstract

[Objective] Tomato ripeness directly determines harvest timing, storage-transportation cycle and market pricing, while appearance defects not only reduce commercial value but also may cause cross-infection during storage, making them core mandatory indicators for automated equipment. Traditional manual detection suffers from low efficiency, strong subjectivity and high miss rate, while existing deep learning models generally have shortcomings of insufficient grading granularity, incomplete functional coverage and poor deployment adaptability, hardly balancing accuracy and real-time performance on low-power edge devices. The aim of this study is to propose a lightweight high-precision integrated tomato detection model to provide reliable visual technical support for automated harvesting and intelligent sorting. [Methods] An improved YOLOv10s tomato detection model named Tomato-YOLO was proposed, which simultaneously achieved fine-grained grading of 4 ripeness categories and integrated identification of 4 appearance defect categories. A tomato detection dataset containing 3 807 images was constructed for the study, integrating 2 221 public samples and 1 586 self-collected field samples and covering multiple complex field scenarios. The dataset was hierarchically and randomly split into training, validation and test sets at a 7:2:1 ratio, and five data augmentation strategies were adopted during training to improve generalization, with a total of 8 detection labels (4 ripeness + 4 appearance defects) set. Four improvements were implemented on the YOLOv10s baseline: First, the Scale-Aware Context Module (SACM) was introduced to replace the C2f module in the backbone network, enhancing the feature capture capability for subtle ripeness differences and micro defects while suppressing field background interference. Second, a cross-layer multi-scale bidirectional feature fusion strategy was constructed and extended to a four-detection-head architecture, with a P2 ultra-small target detection layer added to fill the scale coverage gap of the native architecture and boost perception robustness for small and occluded fruits in complex scenes. Third, the SIoU loss function was adopted to replace the native CIoU loss, paired with an adaptive weighting strategy for small targets, adding angle constraints to optimize bounding box regression accuracy for nearly circular tomatoes and raising the learning priority of hard samples. Fourth, Layer-Adaptive Magnitude Pruning (LAMP) technology was introduced to prune redundant convolutional layers, and the optimal pruning ratio was determined via gradient comparison to achieve lightweight performance with negligible accuracy loss. [Results and Discussions] Experiments were conducted on the RTX3070 platform, and the results showed that the precision, recall and mean average precision (mAP@0.5) of Tomato-YOLO reached 92.1%, 92.0% and 95.0% respectively, 6.9, 11.6 and 6.8 percentage points higher than those of the original YOLOv10s, with significant performance improvements for both defect and ripeness categories. Compared with mainstream models including Faster R-CNN, SSD, YOLOv5s/v8s/v11s/v12s, Tomato-YOLO achieved significantly higher detection accuracy, while its model size and inference speed were comparable to those of native YOLOv10s, striking a balance between accuracy and efficiency. Ablation experiments verified the independent effects and synergistic gains of the four improvements, and pruning experiments identified 15% as the optimal pruning ratio. At this ratio, the model weight was compressed to 15.1 MB, computational load reduced to 27.9 GFLOPs, and accuracy decreased by only 1.2 percentage points, achieving nearly lossless lightweighting. When the pruned model was deployed on the Jetson Nano edge platform, the inference speed reached 30.4 f/s, and the overall mAP@0.5 remained at 93.7%, far exceeding the ≥20 f/s real-time detection threshold for agricultural scenarios, meeting the continuous operation requirements of harvesting equipment. [Conclusions] The Tomato-YOLO proposed in this study effectively addresses the core limitations of existing tomato detection models, achieving a balance of high accuracy and real-time performance for fine-grained ripeness grading and integrated appearance defect identification. It can provide reliable technical support for intelligent harvesting and refined sorting in the tomato industry.

0 引 言

番茄是全球种植规模大、经济价值高的蔬菜作物之一,中国番茄年产量占全球总量30%以上,产业规模化、标准化发展对采收分拣环节的精细化检测提出了迫切需求1。番茄成熟度直接决定其采收时机、储运周期与市场定价,而畸形、裂果、色斑、腐烂等外观缺陷不仅影响商品价值,还可能携带病害导致仓储环节交叉感染,是自动化采收与智能分拣设备必须识别的核心指标2-4。传统依赖人工经验的检测方式存在效率低、主观性强、漏检率高等问题,难以适配大规模种植场景;随着采摘、分拣机器人的普及,亟须开发兼具细粒度成熟度分级、外观缺陷精准识别、边缘端实时推理能力的视觉检测模型,为自动化设备提供可靠的视觉决策依据。
早期番茄检测以传统计算机视觉方法为主,通过分析果实颜色、形态尺寸、表面纹理等特征实现分类,但该类方法对田间光照变化、枝叶遮挡、果实密集等实际场景适应性差,泛化能力不足,对相邻成熟度的细微差异与微小外观缺陷的区分精度有限,难以满足实际作业要求56。深度学习技术的兴起推动了检测性能的显著提升,龙洁花等7通过改进掩码区域卷积神经网络(Mask Region-Convolutional Neural Network,Mask R-CNN)模型实现番茄成熟度识别,其识别正确率达90%。WANG等8通过改进快速区域卷积神经网络(Faster Region-Convolutional Neural Network,Faster R-CNN)模型实现对边界框定位的优化,其在复杂田间遮挡场景下模型整体平均精度均值(mean Average Precision,mAP)达96.1%。两阶段模型普遍存在计算复杂度高、实时性不足的问题9,难以在低算力终端上满足实时检测需求。
YOLO系列单阶段检测算法凭借精度与效率的均衡优势,已成为农业目标检测的主流技术路线。针对番茄检测场景,现有研究已从多个方向开展优化。LIU等10基于YOLOv3设计了圆形边界盒算法,提升了遮挡条件下番茄成熟度的检测效果,但模型参数冗余度高,难以在边缘设备部署;ZENG等11开发轻量化YOLO模型实现了移动端部署,mAP达96.9%,但检测类别仅覆盖成熟度分级,未包含外观缺陷识别;APPE等12在YOLOv5中引入注意力机制减轻果实重叠漏检,准确率达88.1%,但模型对相邻成熟度的细粒度区分能力有限;WANG等13基于YOLOv8s优化损失函数提升了成熟度检测精度,但模型体量较大,边缘部署性能不足;LI等14改进YOLOv10优化了推理实时性,同时模型mAP达91.8%,但模型仅在PC端测速。
综合来看,当前面向番茄的YOLO检测研究仍存在以下短板。一是分级粒度不足。多数研究仅开展2或3类粗粒度成熟度划分,未匹配产业采收通用的青熟、变色、粉红、红熟4级标准15,难以支撑全链条精细化管控需求。二是功能覆盖不全。有模型仅聚焦成熟度分级任务,未将畸形、裂果、色斑、腐烂等外观缺陷纳入一体化识别范畴,易将缺陷果误判为正常可采收果实,存在品质管控漏洞。三是部署适配性不足。高精度模型普遍参数量大、计算复杂度高,轻量化改进又往往伴随明显的精度损失,难以在Jetson Nano等低算力边缘设备上实现精度与实时性的平衡。
针对上述问题,本研究提出一种改进YOLOv10s的番茄一体化检测模型Tomato-YOLO,同步实现4类成熟度细粒度分级与4类外观缺陷识别。模型通过引入尺度感知上下文模块(Scale-Aware Context Module,SACM)替换骨干网络C2f模块,强化细粒度特征提取能力,提升相邻成熟度与微小缺陷的区分精度;构建跨层级多尺度融合结构与四检测头架构,新增P2超小目标检测层填补了原生架构的尺度覆盖空白,增强小目标与遮挡果实的感知能力;采用形状交并比(Shape Intersection over Union,SIoU)加权损失函数优化边界框定位精度;最后通过层自适应幅度剪枝(Layer-Adaptive Magnitude Pruning,LAMP)实现模型轻量化,并实现检测精度与边缘端推理效率的有效平衡。

1 研究材料

1.1 番茄类别划分与特征定义

番茄外观是决定其是否符合采收标准的核心前提,依据现行农艺规范,合格采收番茄需满足以下条件:果实完好无腐烂、无变质,外观新鲜清洁且无异物附着,无畸形果、裂果、空洞果等形态异常,无病虫害导致的损伤,无冻害影响且无异味15。本研究将番茄划分为符合采收标准与不符合采收标准两大类,其具体外观特征如表1所示,其中符合采收标准的番茄依据成熟度细分为青熟、变色、粉红、红熟4个等级;不符合采收标准的番茄涵盖畸形、裂果、色斑及腐烂情形,鉴于此类番茄均不满足采收要求,为便于整体性能统计,新增Defect项作为4类缺陷果的汇总指标,模型实际训练推理为8分类。
表1 番茄类别划分及形态特征描述

Table 1 Classification and morphological characteristics of tomatoes

成熟度 特征图片 形态特征 缺陷番茄 特征图片 形态特征
青熟 果实定形,果面有光泽,颜色为白绿色,可人工催熟、采摘贮藏 畸形 有明显的不正常凹陷或凸起及外形缺陷
变色 由青熟到红熟的过渡期,颜色呈黄色或淡红色,适合短途运输 裂果 表面出现纵裂或环裂
粉红 果实颜色由黄色逐渐转变为红色,着红面积40%~60%,适合短途运输 色斑 表面呈现由病毒或生理等原因引起的色斑块
红熟 果实表面呈现均匀的红色,适合就近售卖 腐烂 表皮皱缩,果实软烂,伴随渗液、异味

1.2 数据集构建与预处理

本研究涉及番茄类别较为丰富,单一公开数据集难以满足实验要求,所以整合公开数据集2 221张、自主拍摄样本1 586张,最终构建包含3 807张图像的实验数据集。该数据集涵盖不同拍摄距离、角度下的单果、多果、枝叶遮挡、强光、背光等多种实际田间场景,能够充分模拟番茄采收过程中的复杂环境,其典型示例如图1所示。
图1 番茄实验数据集典型样本

Fig. 1 Typical samples of the experimental dataset of tomato

为提升模型泛化能力,训练集采用颜色空间变换、亮度调整、色调偏移、随机翻转及高斯噪声5种数据增强策略,验证集与测试集不做增强,增强后的典型样本如图2所示。标注采用半自动标注:先人工标注600张样本训练基础模型,再以0.7置信度批量生成标注,最后人工逐图校验。数据集按7:2:1分层随机划分为训练集、验证集、测试集,保证各类别分布一致。
图2 数据增强后番茄样本示例

Fig. 2 Tomato samples after data augmentation

1.3 类别分布

为避免类别不平衡导致模型偏向多数类,数据采集阶段对各类别样本量进行均衡控制,数据集构建完成后统计各类别标签数量及占比,结果如表2所示。
表2 番茄成熟度与外观缺陷检测实验数据集类别分布统计

Table 2 Category distribution of the experimental dataset for tomato ripeness grading and surface defect detection

类别 标签数量/个 百分比/%
青熟 7 127 15.6
变色 8 406 18.4
粉红 7 675 16.8
红熟 7 812 17.1
畸形 3 472 7.6
裂果 4 020 8.8
色斑 3 792 8.3
腐烂 3 381 7.4

2 研究方法

本研究提出Tomato-YOLO番茄外观及成熟度精细化检测模型,其网络结构如图3,该模型以YOLOv10s为基础架构进行改进,具体改进如下:骨干网络以SACM模块等比替换原有C2f模块;颈部网络使用多尺度特征融合策略,提升模型对田间复杂环境与多尺度目标的适应性;检测头拓展为四检测头架构,新增P2/4-tiny微小目标检测层,提升小目标识别效果。采用SIoU替代完全交并比损失函数(Complete Intersection over Union,CIoU),并结合加权策略,优化缺陷、超小目标的边界框回归精度。最后采用LAMP层自适应剪枝技术裁剪冗余卷积层,通过实验确定最优剪枝比例,在保证检测精度的同时压缩模型体积、提升推理速度,满足边缘设备部署要求。
图3 Tomato-YOLO网络结构

Fig. 3 Tomato-YOLO network architecture

2.1 模型改进方法

2.1.1 SACM模块改进

YOLOv10s骨干网络采用C2f模块作为核心特征提取单元,其采用标准卷积并行堆叠与残差连接的架构设计,面向通用目标检测场景优化,但针对番茄成熟度及外观缺陷识别的特定需求,该模块适配性不足。一方面,C2f模块对所有尺度特征采用相同大小的卷积核处理,细粒度特征捕获能力不足;另一方面,模块未设置背景抑制机制,田间枝叶、光照反光等干扰特征与果实特征被同等加权,易导致缺陷果的误检与漏检。
为解决上述问题,本研究将YOLOv10s骨干网络中的4个C2f模块替换为SACM模块。如图4所示,SACM基于MetaFormer架构设计16,核心包含三层改进:其一为分层令牌混合器设计,浅层采用3×3深度可分离卷积作为令牌混合器,重点捕获表皮颜色梯度、纹理、微小破损等像素级细节特征;深层采用自注意力机制作为令牌混合器,建模果实整体成熟度分布的全局语义特征。其二为尺度感知门控单元,在特征输出端添加可学习的门控权重,动态提升缺陷区域、成熟度过渡区域的特征权重,抑制枝叶、反光等背景干扰。其三为轻量化拓扑优化,全部采用深度可分离卷积替代标准卷积,搭配通道多层感知机实现特征变换,避免增加额外计算开销。
图4 SACM模块结构

Fig. 4 Structure of the SACM module

与C2f模块相比,首先,SACM采用分层处理机制,小卷积核捕捉细节、注意力机制放大特征差异,可使相邻成熟度分级误差降低;其次,C2f模块无背景区分能力,干扰特征与有效特征权重相同,SACM通过尺度感知门控动态过滤背景噪声、强化缺陷区域特征,可使缺陷果召回率提升,降低微小裂果与色斑的漏检率;最后,SACM模块采用深度可分离卷积技术,其计算开销与C2f模块相当,可避免额外的计算开销。

2.1.2 多尺度特征融合

YOLOv10s原生采用路径聚合网络(Path Aggregation Network,PANet)实现相邻层单向特征融合,仅支持P3-P4-P5的相邻层特征单向传递,存在深层语义无法传递至最浅层、浅层细节无法补充至最深层的结构性缺陷。超小果实仅能获得浅层细节特征,缺乏成熟度与类别语义信息,易将绿色枝叶误判为青熟果;大果实仅能获得深层语义特征,缺乏边缘轮廓细节,易出现边界框定位偏差。
针对上述问题,构建跨层级双向特征融合链路,对应图3颈部网络的跨层跳连结构。该策略通过上采样将P5层高语义特征传递至P2、P3层,为小目标补充类别语义信息;通过下采样将P2层细粒度细节特征传递至P4、P5层,为大目标补充边缘轮廓信息;所有跨层级特征拼接后通过可学习权重分配贡献占比,避免冗余特征干扰。
与原生单向融合策略相比,跨层级双向融合实现了浅层细节与深层语义的双向互补,有效降低了小目标的误检概率,提升了大目标检测精度。该策略全面增强了多尺度特征的表征能力17,可使不同尺寸、不同遮挡程度的番茄均获得兼具细节与语义的高质量特征输入。

2.1.3 四检测头架构设计

原YOLOv10s采用P3、P4、P5三层检测头,对应步长8、16、32,最小检测尺度为8×8像素。田间场景中,远距离、半遮挡的番茄成像尺寸多集中于4×4~8×8像素,经下采样后特征易丢失,原生检测头无法覆盖该尺度范围。
针对上述问题,本研究新增专门面向微小目标的P2/4-tiny检测头18,如图5所示,该检测头专门针对4×4至8×8像素的超小目标进行优化,有效填补了原模型在超小目标检测上的能力缺口。四头检测架构通过融合浅层细节特征与深层语义特征,显著提升了模型对小目标的检测能力,尤其强化了对目标细节轮廓特征的捕捉,进而提高检测精度;同时,该改进在增强小目标识别能力的基础上,保留了原有检测头在中、大型目标检测中的性能优势。与原生三检测头相比,四检测头架构实现了番茄目标全尺度覆盖。
图5 番茄检测四检测头特征分配示意图

Fig. 5 Feature allocation schematic of four-detection-head for tomato detection

2.1.4 SIoU损失函数改进

YOLOv10s原生采用CIoU损失进行边界框回归,该损失仅考虑交并比、中心距离、宽高比三个维度,存在以下问题:一是缺乏角度约束,易导致边界框出现偏移、切边等问题;二是所有样本的损失权重相同,模型对难样本的学习优先级不足。
针对上述问题,本研究采用SIoU加权损失替代原生CIoU损失,新增角度损失项,从空间距离、几何角度、形态比例3个维度约束边界框回归,更适配番茄的空间形态与田间成像特征19,核心计算为公式(1):
L S I o U = 1 - I o U + L d i s t + L a n g l e + L s h a p e    
式中:L SIoU为形状交并比损失,IoU为预测框与真实框的交并比;L dist为中心距离损失,L angle为宽高比角度损失,L shape为形态比例损失。在此基础上设计难样本自适应加权策略,构建目标掩码将成像尺寸小于32×32像素、遮挡比例大于等于50%的番茄,以及4类缺陷番茄标记为加权目标,其回归损失权重设置为普通样本的2倍,融合后的加权损失为公式(2):
L S I o U - W = λ o b j m a s k - 1 ( 1 - I o U + L d i s t + L a n g l e + L s h a p e )    
式中:L SIoU-W为加权形状交并比损失,λ为加权系数,经预实验设为2.0;objmask为目标掩码,加权目标赋值为2,普通目标赋值为1。
与原生CIoU损失相比,SIoU加权损失可同步提升定位精度与训练收敛效率:新增角度约束适配番茄近圆形特征,减少框形偏移;难样本加权策略强化缺陷、遮挡样本的梯度贡献,引导模型优先学习难样本特征。

2.1.5 LAMP模型剪枝

前文通过多策略改进得到Tomato-YOLO模型,但网络结构优化带来了参数量与计算量的小幅增加,为此,本研究引入LAMP层自适应幅度剪枝技术,对Tomato-YOLO模型进行结构化轻量化处理,实现模型精度与推理效率的平衡,适配边缘端实时检测需求20-22
根据模型特征提取逻辑,屏蔽对番茄细粒度检测起关键作用的核心层,仅选取冗余度较高的卷积层作为待剪枝层,屏蔽层包括SACM模块令牌混合器核心层、多尺度特征融合通道拼接层;待剪枝层包括骨干网络SACM模块浅层深度可分离卷积层、颈部跨层级多尺度特征融合次级卷积层、检测头非核心卷积层。为确定最优剪枝比例,对所有待剪枝层设计5%、10%、15%、20%、25%、30%、40%、50%共8组梯度剪枝率对比实验。

2.2 实验方法

2.2.1 实验环境及参数设置

本研究的实验平台硬件及软件配置如下:显卡为NVIDIAGeForceRTX3070(显存8 GB),中央处理器(Central Processing Unit,CPU)为Intel® Core™ i5-10400,内存容量32 GB,操作系统采用Windows10;软件环境方面,基于Python3.8编程语言,选用PyTorch2.3.0作为深度学习框架,搭配CUDA12.1加速图形处理器(Graphics Processing Unit,GPU)运算,其他超参数如表3所示。
表3 番茄检测模型训练超参数配置

Table 3 Model training hyperparameter configuration for tomato detection

超参数 配置
epochs 150
Imagesize 640×640
Batchsize 16
workers 8
optimizer SGD
Lr0 0.01
Lr1 0.01

2.2.2 评价指标

本研究采用多项指标评估模型的检测性能,具体包括:精确率(Precision,P),用于衡量番茄预测结果的准确程度,如公式(3)所示;召回率(Recall,R),反映模型对正样本的覆盖能力,如公式(4)所示;平均精度均值mAP@0.5,表示交并比阈值为0.5时的平均精度,如公式(5)所示;模型体量(Size);模型检测速度(Frames Per Second, FPS);计算量(GFLOPs)。
P = n T P n T P + n F P × 100 %
R = n T P n T P + n F N × 100 %
m A P @ 0.5 = 1 n i = 1 n A P i
式中: n T P为真正例,表示所有被正确划分到正样本的数量; n F P为假正例,表示被错误划分到正样本的数量; n F N为假反例,表示被错误划分到负样本的数量23A P表示平均精度;n表示类别数。

3 结果与分析

3.1 改进前后模型性能对比

为直观验证Tomato-YOLO模型对YOLOv10s原生模型的性能提升效果,本研究对比了两款模型在整体类别及各细分类别中的检测性能,实验结果如表4所示,Tomato-YOLO各项检测指标均高于原模型。细分类别中,畸形、裂果、色斑、腐烂共4类缺陷番茄检测性能提升显著,mAP@0.5由84.6%提升至94.3%,精度由83.7%提升至91.6%,召回率由76.8%提升至91.3%,解决了缺陷番茄检测精度低和漏检问题;青熟、变色等4个成熟度类别检测指标均升至91.9%以上,mAP@0.5均达94.7%以上,证明模型有效放大了成熟度细微特征差异,解决了分级边界模糊问题,实现了细粒度精准分级。
表4 改进前后模型的精确率、召回率以及平均精度均值结果对比

Table 4 Comparison of precision, recall and mean average precision of models before and after improvement

模型 类别 P/% R/% mAP@0.5/%
YOLOv10s All 85.2 80.4 88.2
缺陷 83.7 76.8 84.6
畸形 84.1 76.3 84.2
裂果 83.5 76.9 84.5
色斑 83.8 76.8 84.6
腐烂 83.4 77.2 85.1
青熟 86.3 84.3 91.8
变色 86.9 83.1 91.2
粉红 87.1 84.7 92.5
红熟 86.5 83.9 91.7
Tomato-YOLO All 92.1 92.0 95.0
缺陷 91.6 91.3 94.3
畸形 92.3 91.6 94.9
裂果 91.2 90.4 93.5
色斑 91.8 91.9 94.8
腐烂 91.1 91.3 94.0
青熟 92.7 93.2 96.2
变色 92.3 92.7 95.2
粉红 92.6 92.4 95.9
红熟 92.8 92.5 95.5

注:缺陷为畸形、裂果、色斑、腐烂这4类缺陷番茄的平均统计结果

3.2 主流模型性能对比

为进一步验证Tomato-YOLO模型在番茄外观及成熟度检测任务中的综合优势,本研究选取FasterR-CNN、SSD两款经典的两阶段检测模型,以YOLOv5s、YOLOv8s、YOLOv10s、YOLOv11s、YOLOv12s这5款主流单阶段YOLO系列模型作为对比,结果如表5所示:
表5 改进模型与主流模型检测性能结果对比

Table 5 Detection performance comparison between the improved model and mainstream models

模型 P/% R/% mAP@0.5/% Size/MB 计算量/GFLOPs FPS/(帧/s)
FasterR-CNN 59.3 68.0 67.6 138.3 402.1 2.0
SSD 77.4 61.6 73.8 93.0 274.7 4.0
YOLOv5s 87.0 83.6 89.2 18.5 23.8 31.2
YOLOv8s 87.8 83.0 88.6 22.5 28.4 28.4
YOLOv10s 85.2 80.4 88.2 16.5 21.4 41.2
YOLOv11s 87.1 84.2 89.5 19.2 21.3 39.3
YOLOv12s 86.5 83.8 89.1 18.8 22.0 40.5
Tomato-YOLO 92.1 92.0 95.0 17.7 32.5 40.8

注:本表中指标均基于PC端平台测试得到。

两阶段模型FasterR-CNN、SSD检测精度低且计算复杂度高,无法满足实时检测需求;在YOLO系列单阶段模型中,YOLOv10s模型的轻量化性能最优,权重为16.5 MB,计算量为21.4 GFLOPs,但检测性能较差;YOLOv11s检测性能最好,但其权重高于YOLOv10s。相较之下,本研究提出的Tomato-YOLO模型检测性能优于各主流检测模型,模型尺寸和FPS指标与YOLOv10s相当,且经15%剪枝后其权重为15.1 MB,低于YOLOv10s模型,证明Tomato-YOLO模型更适配番茄外观及成熟度的细粒度检测任务。

3.3 消融实验

为验证四检测头、SACM+多尺度特征融合、SIoU+小目标加权3项核心改进策略的独立作用与协同优化效果,本研究以YOLOv10s模型为基准,设计八组消融实验,全面分析各策略对模型检测性能与轻量化指标的影响,结果如下表6所示。
表6 消融实验下模型的精确率、召回率、平均精度均值、模型体量以及计算量结果对比表

Table 6 Ablation study results: comparison of precision, recall, mean average precision, model size and computational complexity

四检测头 SACM+多尺度 SIOU+小目标加权 P/% R/% mAP@0.5/% Size/MB 计算量/GFLOPs
× × × 85.2 80.4 88.2 16.5 21.4
× × 87.4 86.3 91.2 16.9 28.7
× × 90.4 82.3 91.3 16.8 25.8
× × 87.6 85.5 90.8 16.6 23.1
× 91.3 87.9 93.6 17.1 30.1
× 87.3 91.3 93.3 17.5 31.0
× 91.5 86.4 92.9 17.3 28.3
92.1 92.0 95.0 17.7 32.5
仅引入四检测头架构时,模型mAP@0.5从88.2%提升至91.2%,召回率提升5.9%至86.3%,精度微升2.2%,证明四检测头架构对小目标、遮挡目标检测能力的提升作用,有效解决了原模型的漏检问题;仅引入SACM+多尺度特征融合后,模型mAP@0.5提升至91.3%,精度达90.4%,其中缺陷番茄类mAP@0.5由84.6%提升至90.2%,精度由81.7%提升至89.7%,召回率由76.8%提升至80.6%,各指标均有所提升,这表明该优化策略能够有效剥离背景干扰,增强模型对前景缺陷特征的表征能力,精准提取番茄缺陷区域的关键特征,进而提升缺陷番茄的整体检测性能;仅引入SIoU+小目标加权时,模型各指标有所上涨,其中缺陷番茄召回率相比原模型显著提升10.3个百分点,模型边界框回归损失变化如图6a所示,证明边界框回归损失优化的有效性,提升了模型的定位精度,解决了缺陷番茄、复杂环境下的定位不准问题。
任意两项策略融合时,相较于单一策略检测性能更优,体现了策略间的互补性,其中引入SACM、多尺度特征融合,以及损失函数的改进,对于缺陷番茄类影响最为显著,其mAP@0.5、精度、召回率分别达到94.8%、91.8%、91.6%。当融合三项策略时,其mAP@0.5变化如图6b所示,模型性能达到最佳,精度达92.1%、召回率达92.0%、mAP@0.5达95.0%,相较于基准模型,mAP@0.5提升6.8个百分点、精度提升6.9个百分点、召回率提升11.6个百分点,证明本研究提出的多策略融合改进思路具有科学性与有效性,有效解决了原模型在番茄检测中存在的细粒度分级模糊、缺陷番茄误检漏检、复杂环境定位不准等核心问题,是Tomato-YOLO模型性能提升的关键。
图6 改进前后模型的边界框回归损失与平均精度均值随训练轮次曲线变化对比图

Fig. 6 Training Curve Comparison: Box Loss and mAP@0.5 Before and After Model Improvement

3.4 剪枝对比实验

为保证模型检测性能的同时减少模型权重,本研究设计5%~50%八组梯度剪枝率实验确定最优剪枝比例。实验结果如表7所示,在比例剪枝5%~15%时,检测性能基本无损且模型权重有所降低;剪枝率超20%后,模型特征提取能力受损,检测性能快速下降,50%剪枝率下mAP@0.5仅59.2%,难以满足实际作业要求。综合检测性能与轻量化效果,最终选取15%为最优剪枝比例,该比例下模型权重压缩至15.1 MB,计算量降至27.9 GFLOPs,精度仅下降1.2个百分点,在检测性能基本无损的前提下,实现了冗余参数的有效精简,FPS得到提升,更适配边缘端硬件部署24
表7 不同剪枝率下的剪枝效果对比

Table 7 Pruning effect comparison under different pruning rates

剪枝方法 剪枝率 P/% R/% mAP@0.5/% Size/MB 计算量/GFLOPs
LAMP 0 92.1 92.0 95 17.7 32.5
5 92.2 91.8 94.8 16.8 30.9
10 91.5 91.6 93.9 15.9 29.4
15 91.2 91.6 93.8 15.1 27.9
20 90.2 89.3 91.8 14.3 26.5
25 89.3 88.7 89.5 13.5 25.2
30 86.8 85.3 88.2 12.8 23.9
40 78.3 76.8 80.1 11.2 21.4
50 51.8 48.0 59.2 9.6 18.9

注:本表中指标均基于PC端平台测试得到。

3.5 边缘设备部署

随着智慧农业与田间自动化作业装备的规模化应用,检测模型在边缘设备部署能力已成为衡量其工程实用价值的关键指标。本研究选取Jetson Nano作为部署平台,对经15%最优剪枝率处理的Tomato-YOLO模型进行测试,模型运行时GPU占用率稳定在65%~70%,内存占用小于2 GB,算力冗余充足。试验结果如表8所示,模型Jetson Nano平台上的综合检测结果:整体精确率91.0%、召回率91.8%、mAP@0.5为93.7%;其中4类缺陷番茄平均指标为精确率90.2%、召回率91.0%、mAP@0.5为92.6%,4类成熟度番茄检测mAP@0.5均高于94.3%。可见模型在边缘设备上仍保持较高检测精度,精度损失控制在可接受范围内。
表8 经15%剪枝后Tomato-YOLO模型在Jetson Nano边缘设备的部署检测性能结果表

Table 8 Detection performance results of the 15% pruned tomato-YOLO model deployed on jetson nano edge device

类别 P/% R/% mAP@0.5/%
All 91.0 91.8 93.7
缺陷 90.2 91.0 92.6
畸形 91.1 90.2 92.4
裂果 89.6 91.4 92.3
色斑 89.3 91.5 93.2
腐烂 90.8 90.9 92.5
青熟 92.0 92.6 94.9
变色 91.4 92.3 94.3
粉红 92.1 92.1 94.6
红熟 91.7 93.4 95.4
部署完成后,通过视频流进行验证。测试结果如图7所示,轻量化 Tomato-YOLO模型在Jetson Nano平台平均输出推理帧率30.4 帧/s,远超农业场景≥20 帧/s的实时检测阈值,且对番茄成熟度判定与各类外观缺陷均具备优异的识别精度,满足自动化采收与在线分拣的实时性要求。模型在长时间连续推理过程中无明显掉帧、延迟与精度衰减现象,展现出良好的部署稳定性与田间环境鲁棒性25,为番茄外观及成熟度实时检测技术的工程化落地与产业应用提供了稳定可靠的技术方案。
图7 剪枝后Tomato-YOLO模型在Jetson Nano边缘设备的番茄检测可视化结果图

注:Green为青熟;Turn为变色;Firm为粉红;Full为红熟;Malformed为畸形;Rotten为腐烂;Spotted为色斑。

Fig. 7 Visualized tomato detection results of the pruned tomato-YOLO model on jetson nano edge device

4 结 论

现有番茄成熟度检测模型难以兼顾精度与部署开销,多为粗粒度分级,且未纳入畸形、裂果等缺陷类别,易造成劣质果误判,实际适配性较弱。本研究以YOLOv10s模型为基线,提出Tomato-YOLO检测模型,实现番茄成熟度精细化分级与外观缺陷的一体化识别,具体改进包括引入SACM尺度感知上下文模块强化特征提取、设计跨层级多尺度特征融合策略与四检测头架构以提升小目标及遮挡目标检测能力、采用SIoU损失函数与自适应加权机制优化定位精度,引入LAMP层剪枝技术平衡模型检测性能与推理效率。
实验结果表明,Tomato-YOLO模型在测试集上的精确率、召回率及mAP@0.5分别达到92.1%、92.0%与95.0%,较原始YOLOv10s模型显著提升;其中缺陷番茄类别的检测性能提升最为突出,有效弥补了现有模型对缺陷番茄识别重视不足、劣质果实易误判漏判的技术短板。经15%比例LAMP剪枝后,模型权重压缩至15.1 MB,计算量降至27.9 GFLOPs,部署于Jetson Nano边缘计算平台时FPS稳定达到30.4 帧/s,在保持较高检测精度的前提下满足了自动化采收与分拣设备的实时性需求,实现了检测性能与部署开销的有效平衡。该模型弥补了现有方法在成熟度细粒度分级与外观缺陷一体化识别方面的不足,为番茄智能化采收、精细化分拣提供了兼具精度与实时性的视觉检测技术支持。

本研究不存在研究者以及与公开研究成果有关的利益冲突。

[1]
李君明, 项朝阳, 王孝宣, 等. "十三五" 我国番茄产业现状及展望[J]. 中国蔬菜, 2021(2): 13-20.

LI J M, XIANG C /Z)Y, WANG X X, et al. Current situation of tomato industry in China during' the thirteenth Five-Year Plan' period and future prospect[J]. China Vegetables, 2021(2): 13-20.

[2]
XIAO X, WANG Y N, JIANG Y M. Review of research advances in fruit and vegetable harvesting robots[J]. Journal of Electrical Engineering & Technology, 2024, 19(1): 773-789.

[3]
赵玉清, 何茂昌, 胡惠永, 等. 基于改进YOLOv8n的设施环境下成熟番茄检测方法[J]. 华南农业大学学报, 2026, 47(4): 661-673.

ZHAO Y Q, HE M C, HU H Y, et al. Detection method for mature tomatoes in facility environmentsbased on improved YOLOv8n[J]. Journal of South China Agricultural University, 2026, 47(4): 661-673.

[4]
EL-SHEIKH E A, LI D Y, HAMED I, et al. Residue analysis and risk exposure assessment of multiple pesticides in tomato and strawberry and their products from markets[J]. Foods, 2023, 12(10): 1936.

[5]
FAWZIA RAHIM U, MINENO H. Highly accurate tomato maturity recognition: combining deep instance segmentation, data synthesis and color analysis[C]// Proceedings of the 2021 4th Artificial Intelligence and Cloud Computing Conference. New York, USA: ACM, 2022: 16-23.

[6]
NASSIRI S M, TAHAVOOR A, JAFARI A. Fuzzy logic classification of mature tomatoes based on physical properties fusion[J]. Information Processing in Agriculture, 2022, 9(4): 547-555.

[7]
龙洁花, 赵春江, 林森, 等. 改进Mask R-CNN的温室环境下不同成熟度番茄果实分割方法[J]. 农业工程学报, 2021, 37(18): 100-108.

LONG J H, ZHAO C J, LIN S, et al. Segmentation method of the tomato fruits with different maturities under greenhouse environment based on improved Mask R-CNN[J]. Transactions of the Chinese Society of Agricultural Engineering, 2021, 37(18): 100-108.

[8]
WANG Z, LING Y, WANG X L, et al. An improved Faster R-CNN model for multi-object tomato maturity detection in complex scenarios[J]. Ecological Informatics, 2022, 72: 101886.

[9]
孙宇朝, 李守豪, 夏秀波, 等. 利用改进YOLOv5s模型检测番茄果实成熟度及外观品质[J]. 园艺学报, 2024, 51(2): 396-410.

SUN Y C, LI S H, XIA X B, et al. Detecting tomato fruit ripeness and appearance quality based on improved YOLOv5s[J]. Acta Horticulturae Sinica, 2024, 51(2): 396-410.

[10]
LIU G X, NOUAZE J C, TOUKO MBOUEMBE P L, et al. YOLO-tomato: A robust algorithm for tomato detection based on YOLOv3[J]. Sensors, 2020, 20(7): 2145.

[11]
ZENG T H, LI S Y, SONG Q M, et al. Lightweight tomato real-time detection method based on improved YOLO and mobile deployment[J]. Computers and Electronics in Agriculture, 2023, 205: 107625.

[12]
APPE S N, ARULSELVI G, GN B. CAM-YOLO: Tomato detection and classification based on improved YOLOv5 using combining attention mechanism[J]. PeerJ Computer Science, 2023, 9: e1463.

[13]
WANG A C, QIAN W H, LI A, et al. NVW-YOLOv8s: An improved YOLOv8s network for real-time detection and segmentation of tomato fruits at different ripeness stages[J]. Computers and Electronics in Agriculture, 2024, 219: 108833.

[14]
LI A, WANG C R, JI T T, et al. D3-YOLOv10: improved YOLOv10-based lightweight tomato detection algorithm under facility scenario[J]. Agriculture, 2024, 14(12): 2268.

[15]
GH/T 1193-2021 中华人民共和国供销合作行业标准: 番茄 [S].

[16]
DOSOVITSKIY A, BEYER L, KOLESNIKOV A, et al. An image is worth 16x16 words: transformers for image recognition at scale[PP/OL]. arXiv.2010.11929, 2021.

[17]
WANG Y, ZHANG P X, TIAN S. Tomato leaf disease detection based on attention mechanism and multi-scale feature fusion[J]. Frontiers in Plant Science, 2024, 15: 1382802.

[18]
CHEN D F, ZHANG L C. SL-YOLO: A stronger and lighter drone target detection model[J]. arXiv: 2411 11477, 2024.

[19]
HUANG W Y, LIAO Y R, WANG P L, et al. AITP-YOLO: Improved tomato ripeness detection model based on multiple strategies[J]. Frontiers in Plant Science, 2025, 16: 1596739.

[20]
杨森, 张鹏超, 王磊, 等. 集成改进YOLOv8n与通道剪枝的轻量化番茄叶片病虫害识别方法[J]. 农业工程学报, 2025, 41(2): 206-214.

YANG S, ZHANG P C, WANG L, et al. Identifying tomato leaf diseases and pests using lightweight improved YOLOv8n and channel pruning[J]. Transactions of the Chinese Society of Agricultural Engineering, 2025, 41(2): 206-214.

[21]
YOU H H, WANG H, WEI Z C, et al. VBP-YOLO-prune: Robust apple detection under variable weather via feature-adaptive fusion and efficient YOLO pruning[J]. Alexandria Engineering Journal, 2025, 128: 992-1014.

[22]
杨振杰, 张嘉辉, 刘隽谦, 等. 基于YOLOv8n-seg的红壤团聚体裂隙轻量化检测分割方法[J]. 农业工程学报, 2025, 41(23): 77-86.

YANG Z J, ZHANG J H, LIU J Q, et al. Detecting and segmenting red loam aggregate cracks using lightweight YOLOv8n-seg[J]. Transactions of the Chinese Society of Agricultural Engineering, 2025, 41(23): 77-86.

[23]
林志兴, 王立可. 基于深度特征和Seq2Seq模型的网络态势预测方法[J]. 计算机应用, 2020, 40(8): 2241- 2247.

LIN Z X, WANG L K. Network situation prediction method based on deep feature and Seq2Seq model[J]. Journal of Computer Applications, 2020, 40(8): 2241-2247.

[24]
赵丽成, 卢鑫羽, 吴茜, 等. 基于改进YOLOv10和LAMP通道剪枝的串番茄成熟度检测算法研发[J]. 智慧农业(中英文), 2026, 8(2): 133-146.

ZHAO L C, LU X Y, WU Q, et al. An improved YOLOv10-based tomato ripeness detection algorithm with LAMP channel pruning[J]. Smart Agriculture, 2026, 8(2): 133-146.

[25]
LIU X K, TENG W J, YU H R, et al. GAE-YOLO: A lightweight multimodal detection framework for tomato smart agriculture with edge computing[J]. Frontiers in Plant Science, 2025, 16: 1712432.

文章导航

/