欢迎您访问《智慧农业(中英文)》官方网站! English

基于YOLOv11n-A3的油菜角果检测与计数方法

  • 周霖 1, 2 ,
  • 王妍 1, 2 ,
  • 黎海欣 3 ,
  • 郑吉澍 1, 2 ,
  • 李脉 1, 2 ,
  • 曹中华 1, 2 ,
  • 吴兆娟 , 1, 2
展开
  • 1. 重庆市农业科学院农业工程研究所,重庆 401329,中国
  • 2. 农业农村部西南山地智慧农业重点实验室(部省共建),重庆 401329,中国
  • 3. 慕尼黑工业大学计算、信息与技术学院,慕尼黑 80333,德国
吴兆娟,博士,副研究员,研究方向为农业人工智能。Email:

周 霖,硕士,工程师,研究方向为农业人工智能。Email:

收稿日期: 2026-03-05

  网络出版日期: 2026-05-22

基金资助

重庆市级财政科技创新类项目(KYLX20240500073)

重庆市级财政科技创新类项目(KYLX20260200049)

国家重点研发计划项目(2022YFD2001700)

成渝地区双城经济圈农业科技创新联盟(共建国家现代农业产业科技创新中心)子项目(KYLX20250600465)

Rapeseed Silique Detection and Counting Based on YOLOv11n-A3

  • ZHOU Lin 1, 2 ,
  • WANG Yan 1, 2 ,
  • LI Haixin 3 ,
  • ZHENG Jishu 1, 2 ,
  • LI Mai 1, 2 ,
  • CAO Zhonghua 1, 2 ,
  • WU Zhaojuan , 1, 2
Expand
  • 1. Institute of Agricultural Engineering, Chongqing Academy of Agricultural Sciences, Chongqing 401329, China
  • 2. Key Laboratory of Smart Agriculture in Southwest Mountainous Areas, Ministry of Agriculture and Rural Affairs (Co-constructed by Ministry and Province), Chongqing 401329, China
  • 3. TUM School of Computation, Information and Technology, Munich 80333, Germany
WU Zhaojuan, E-mail:

ZHOU Lin, E-mail:

Received date: 2026-03-05

  Online published: 2026-05-22

Supported by

Chongqing Municipal Financial Science and Technology Innovation Projects(KYLX20240500073)

Sub-project of the Chengdu-Chongqing Economic Circle Agricultural Science and Technology Innovation Alliance (Jointly Building the National Modern Agricultural Industry Science and Technology Innovation Center)(KYLX20250600465)

Copyright

copyright©2026 by the authors

摘要

【目的/意义】 快速精准地检测油菜角果数量,对油菜高产优质品种选育具有重要意义。针对油菜离体考种场景下,分枝角果普遍存在密集簇生、局部重叠及果喙目标微小所导致的精准计数难题,提出一种基于YOLOv11n-A3(YOLOv11n with Area Attention and Aligned Fusion)的油菜角果检测与计数方法。 【方法】 在主干网络集成跨阶段局部空间注意力模块与快速空间金字塔池化模块以强化特征的多维联合表达,并在颈部构建融合区域注意力模块的对齐路径聚合特征金字塔网络架构,从而协同缓解空间信息错位并提升区域上下文交互能力。 【结果和讨论】 YOLOv11n-A3在精确率、召回率、平均精度均值分别达到了92.6%、85.1%、47.1%,较基线模型分别提高了1.8、2.5、12.5个百分点。模型的计算量、参数量、检测速度分别达6.39 GFLOPs、2.58 M、625.3帧/s。在角果计数任务中,决定系数达0.937,平均绝对误差仅为2.61个。 【结论】 YOLOv11n-A3模型在保持轻量化的同时提高了计数精度,能够有效检测密集分布场景下的小目标,基于模型开发的油菜育种人工智能工具,可实现对油菜角果的检测与计数,为油菜考种与高产优质品种选育提供技术支撑。

本文引用格式

周霖 , 王妍 , 黎海欣 , 郑吉澍 , 李脉 , 曹中华 , 吴兆娟 . 基于YOLOv11n-A3的油菜角果检测与计数方法[J]. 智慧农业, 2026 : 1 -12 . DOI: 10.12133/j.smartag.SA202603005

Abstract

[Objective] Rapeseed is the largest oilseed crop in China, and increasing its yield is the core objective of breeding efforts. As a central component of rapeseed yield, the number of effective siliques per plant is an indispensable phenotypic trait in the phenotyping process. Its rapid and accurate counting is crucial for the breeding of high-yield and superior varieties. Although object detection and counting research has made significant progress in the agricultural field, it still faces some challenges in actual detached phenotyping scenarios. Therefore, aiming at the accurate counting difficulties caused by the widespread dense clustering, local overlapping of branches, and tiny silique beak targets in detached rapeseed phenotyping scenarios, a rapeseed silique detection and counting method is proposed based on YOLO11n-A3 (YOLO11n with Area Attention and Aligned Fusion). This method improves detection accuracy and feature extraction efficiency while maintaining a lightweight design, providing edge-side technical support for rapeseed phenotyping and the breeding of high-yield, high-quality varieties. [Methods] The proposed method adopted the lightweight convolutional structure of YOLOv11n as its backbone. To further enhance the global representation capability of silique features, the cross stage partial with spatial attention (C2PSA) module was embedded in the high-level layers of the backbone for joint channel-spatial modeling. This approach significantly improved the representation of multi-scale features while retaining the receptive-field-expansion advantage of the spatial pyramid pooling fast (SPPF) module, without substantially increasing computational costs. Secondly, the Area Attention module was introduced to locally enhance the neck feature fusion network. By replacing specific convolutions with the Area Attention module, the network leverages local region perception to improve feature extraction and anti-interference capabilities for densely overlapping small targets, while keeping training and deployment risks controllable. Finally, a bidirectional feature alignment and fusion architecture consisting of aligned feature pyramid network (Align-FPN) and aligned path aggregation network (Align-PAN) were constructed to replace the standard feature fusion path. In the Align-FPN stage, high-level semantic features were effectively transmitted to lower levels via the area-attention enhanced cross-feature (A2C2f) module and tiny multi-scale context (TMC) block (P3), the soft nearest neighbor interpolation (SNI) module were introduced to alleviate spatial inconsistencies among multi-scale features. In the Align-PAN stage, the extended spatial-window down-sampling (ESD) module was further combined for feature separation and enhancement, highlighting key scale features through an adaptive weighted fusion mechanism to significantly enhance the interaction and consistency of multi-scale features. [Results and Discussions] The precision, recall, and mAP0.5-0.95 of YOLOv11n-A3 reached 92.6%, 85.1%, and 47.1%, respectively, showing increases of 1.8, 2.5, and 12.5 percentage points over the baseline model. The computational load, parameter count, and detection speed of the model reached 6.39 GFLOPs, 2.58 M, and 625.3 f/s, respectively. In the silique counting task, the coefficient of determination (R2) reached 0.937; the mean absolute error (MAE) was only 2.61; the root mean square error (RMSE) was 3.7; and the mean absolute percentage error (MAPE) was 11.37%. Furthermore, to meet the application requirements of real-time field phenotyping, the lightweight model was encapsulated and deployed in a custom-developed artificial intelligence (AI) tool to achieve fast and accurate counting of rapeseed siliques. This effectively verified the engineering application potential of the proposed lightweight algorithm on edge devices. [Conclusions] The YOLOv11n-A3 model successfully improves counting accuracy while maintaining a lightweight design, effectively detecting small targets in densely distributed scenarios. The rapeseed breeding AI tool developed based on this model achieves the rapid and accurate detection and counting of rapeseed siliques, providing reliable technical support for rapeseed phenotyping and the breeding of high-yield, high-quality varieties. In summary, YOLO11n-A3 achieved an excellent balance among detection accuracy, counting precision, and computational overhead, fully demonstrating its lightweight and highly efficient superiority.

0 引 言

油菜是中国第一大油料作物1,其产量提升是育种工作的核心目标。单株有效角果数作为油菜产量构成的核心因子1,是考种过程中必不可少的关键性状参数,其精准计数对高产、优良品种的选育至关重要2。然而,传统的人工离体考种面临效率低、劳动强度大的局限。特别是在面对密集簇生、相互挤压的角果时,操作者极易因长时间注视微小果喙引发视觉疲劳,导致错漏检现象频发,难以保证数据精度。此外,人工计数的低通量特性极易导致考种工作错失关键生育期,造成表型数据失效并严重延误育种周期。因此,开发一种准确、高效、实时油菜角果检测与计数技术,对降低考种劳动强度,加快育种速度具有重要意义3
在油菜角果识别与计数研究中,已有学者主要从基于点云的三维重建与分析入手开展探索。徐胜勇等4提出一种基于RGB-D相机的油菜分枝三维重建和角果识别定位方法,角果识别准确率达96.76%,点云配准单项处理耗时为124.2 s。谢忠红等5采用双目相机采集油菜分枝的多视角点云数据,提出基于内部形状描述子-线性同余法(Intrinsic shape signature-Linear congruential generator, ISS-LCG)组合特征点的配准方法,将配准误差降至0.066 mm,点云特征点平均配准时间为8.706 s。LIU等6提出一种基于改进PointNet++的油菜角果分割与计数模型KAN-GLNet(Kolmogorov-Arnold Network with Global-Local Feature Modulation),该算法实现了油菜角果高精度计数,语义分割平均交叉比(mean Intersection over Union, mIoU)达94.50%,计数准确率达97.45%。通过点云的三维重建与分析可准确识别分枝及单株的油菜角果数量,然而,点云技术受限于高昂的设备算力成本、冗长的处理时间与复杂的操作门槛,难以满足大田考种低成本、普适化的落地需求。
近年来,深度学习驱动的目标检测与计数算法在智慧农业领域实现了广泛落地与应用。在改进卷积神经网络方面,陈韬等7在点对点网络(Point-to-Point Network, P2PNet)基础上引入高效通道注意力与坐标通道混洗模块,构建了猪只计数模型,较好地解决了复杂场景下猪只的漏检和误检问题。孙守鑫等8提出一种基于无人机图像和多尺度注意力时间卷积网络(Multi-scale Attention Temporal Convolutional Network, MSA-TCN)模型的烟株计数方法,实现山地环境下烟株的高精度密度图计数。目前多数高性能卷积模型通常通过增加网络深度或引入多尺度特征融合、注意力机制等结构来提升准确率,但这类方法往往导致模型参数量与计算量显著增加,限制了其在边缘设备上的实时部署能力,同时在真实复杂农业场景中的鲁棒性仍有待提升910
YOLO系列算法凭借其高效、轻便、泛化性强及鲁棒性稳定等特点,已成为学术界焦点11-13。针对辣椒叶片病虫害问题,姚晓通等14对YOLOv12s检测算法进行改进,该模型较原算法参数量下降了61.5%,同时平均精度均值(mean Average Precision, mAP)提升了2.0%。黄志豪等15通过集成动态卷积与轻量化特征融合网络优化了YOLOv11n模型,以提高复杂果园环境下苹果的检测性能。李尚平等16提出一种改进的YOLOv11n网络模型(YOLOv11n-EWL),该模型在甘蔗芽图像测试集上的检测速度和准确率均有显著提高。
尽管目标检测与计数研究在农业领域已取得显著进展,但在实际离体考种场景下仍面临以下挑战:一是现有部分研究算法在应对微小目标密集簇生、严重遮挡重叠及多变光照等干扰时适应性较差,难以满足实际考种需求。二是部分性能提升模块的引入增加了模型的计算开销与推理延迟,导致实时性受限1718。为此,本研究提出一种基于改进YOLOv11n的油菜角果检测与计数方法,在保持轻量化的同时提升检测精度和特征提取效率,为油菜考种及高产优质品种选育提供端侧技术支撑。

1 数据采集和预处理

1.1 数据采集

在2024年5月5日至7日、2025年8月11日至16日,分别于重庆市农业科学院农业工程研究所试验田、青海省湟中区海子沟乡与鲁沙尔镇农户种植田,采集处于成熟期的庆油3号与青杂9号油菜植株。为贴近实际考种需求并增强数据集的多样性,人工剪取植株分枝后,分别在室内、室外遮阴及田间自然光照三种环境下进行拍摄(如图1)。采集设备为iPhone 15智能手机,拍摄距离控制在30~50 cm,获取分辨率4 032×3 024像素的RGB图像共3 842幅,其中田间图像2 453幅、室外图像825幅、室内图像564幅。
图1 油菜角果的图像采集示例

Fig. 1 Examples of collected rapeseed silique images

1.2 数据集构建

鉴于角果高密度生长与多角度重叠,直接检测整体易导致边界模糊和重复计数。相比之下,果喙作为角果唯一的细长终端,不仅特征显著且无籽粒填充,与充实区差异明显。因此,选取果喙作为检测目标,以降低密集场景下的漏检与误检率。使用LabelImg工具对原始图像中的成熟油菜角果喙区域顶端进行方形框标注(图2),共标注图像3 842张、标注框97 348个,储存为YOLO格式文件。训练设置中,数据集按8:1:1的比例划分为3 074张训练集、384张验证集与384张测试集。
图2 油菜角果的图像标注示例

Fig. 2 Examples of rapeseed silique image annotation

为提升目标模型的鲁棒性与泛化能力,本研究在训练阶段采用开源计算机视觉库Ultralytics提供的数据增强功能(v8_transforms),对输入图像进行随机在线扰动。首先通过Mosaic将多张图像拼接以提升目标密度,并叠加随机透视/仿射变换;随后以一定概率引入Copy-Paste、MixUp与CutMix等混合增强策略;在此基础上,再进行色调、饱和度、明度(Hue, Saturation, Value, HSV)颜色空间扰动与随机翻转以增强对成像条件变化的适应性。不同于传统的训练前数据增强策略,本研究采用训练中增强策略,随机组合上述图像变化方法,数据随机梯度优化,即每个轮次都能使用重新增强的数据,极大提升了有限数据量下的模型泛化能力。此策略使训练集大致扩展至2 710×n_epoch×p,其中n_epoch为轮次,取值最大为100,考虑到实际训练采用了早停策略,模型会在验证集性能不再提升时终止训练,因此实际有效训练轮次具有不确定性,p=0.5为随机增强概率。

2 研究方法

2.1 YOLOv11n网络模型优化及改进

针对油菜角果密集重叠与果喙微小导致的精准检测难题,本研究对YOLOv11n基线模型进行改进,提出改进模型YOLOv11n-A3(YOLOv11n with Area Attention and Aligned Fusion),其网络结构如图3所示。主体沿用YOLOv11n的轻量化卷积结构,为进一步增强模型对角果特征的全局表达能力,在主干网络高层嵌入跨阶段局部空间注意力(Cross Stage Partial with Spatial Attention, C2PSA)模块以进行通道与空间的联合建模;在保留快速空间金字塔池化(Spatial Pyramid Pooling Fast, SPPF)模块扩大感受野优势的同时,显著提升多尺度特征的表征能力,且未大幅增加计算成本。其次,引入区域注意力(Area Attention,A2)模块19,对颈部特征融合网络进行局部增强。将原有的部分卷积替换为A2模块,旨在保持训练与部署风险可控的同时,利用其局部区域感知能力,提升网络对密集重叠小目标的特征提取与抗干扰能力。最后,构建了由对齐特征金字塔网络(Aligned Feature Pyramid Network, Align-FPN)与对齐路径聚合网络(Aligned Path Aggregation Network, Align-PAN)组成的双向特征对齐与融合结构,以替代原有的标准特征融合路径。在Align-FPN阶段,通过区域注意力增强型交叉特征模块(Area-Attention Enhanced Cross-Feature module, A2C2f)与上下文增强(Tiny Multi-Scale Context, TMC)模块(P3)实现高层语义特征向低层特征的有效传递,并引入可扩展邻域交互(Soft Nearest Neighbor Interpolation, SNI)模块以缓解不同尺度特征在空间分布上的不一致问题;在Align-PAN阶段,进一步结合高效空间下采样(Extended Spatial-window Down-sampling, ESD)模块对特征进行分离与增强,通过自适应加权融合机制突出关键尺度特征,从而显著增强多尺度特征之间的交互能力与一致性。
图3 YOLOv11n-A3网络结构图

Fig. 3 YOLOv11n-A3 network architecture

2.1.1 区域注意机制

为提升密集小目标表征能力,本研究在YOLOv11n基线模型的颈部网络中引入A2模块,该模块通过区域级上下文建模增强空间信息交互,在计算开销较小的情况下缓解小目标特征稀疏问题,并强化油菜分枝结构与果尖空间关联建模,从而提升遮挡和密集分布场景下的果尖识别效果。A2模块结构如图4所示。
图4 Area Attention模块结构

注:图中省略了较为常见的下游部分。

Fig. 4 Architecture of Area Attention module

A2C2f为封装A2的特征提取器(结构如图5所示),其本质是在经典C2f20框架中引入注意力块后的“分段聚合”单元。具体而言,输入特征先经1×1卷积投影生成初始特征y 0,随后y 0依次穿过串联堆叠的A2子单元,进行逐级特征增强并输出一系列中间特征yi。在特征汇聚阶段,模块将y 0与各阶段的中间特征yi 在通道维度上进行跨阶段拼接,再经末端1×1卷积完成融合与压缩,以显式保留不同深度的表征信息。最后,结合可选的残差连接以促进梯度传播。该设计兼顾了注意力机制的上下文建模能力与C2f的高效特征聚合特性,显著提升了特征提取的表达力。
图5 A2C2f结构

Fig. 5 Architecture of A2C2f

2.1.2 TMC模块

为降低密集小目标的漏检风险并提升边界定位稳定性,本研究在特征融合阶段提出了轻量化的上下文增强模块TMC(结构如图6所示)。该模块在保持特征图尺寸与通道数不变的前提下,首先将输入特征送入两条并行的深度卷积(Depthwise Convolution, DConv)分支,其中一支空洞率(dilation)为1,另一支空洞率为2,以此在不采样的情况下获取多尺度空间特征。两分支输出经逐元素相加后,再通过1×1逐点卷积(Pointwise Convolution, PWConv)完成通道间的信息交互与混合,并接入二维批量归一化(Batch Normalization 2d, BN2d)层。最后,模块通过残差连接将原始输入与主分支特征相加,并由Sigmoid线性单元(Sigmoid Linear Unit, SiLU)激活输出。
图6 TMC模块

Fig. 6 Architecture of TMC module

在本研究的角果检测场景中,TMC的价值重点体现在与小目标细节密切相关的P3尺度(stride=8)上。它以极低的参数和计算代价,有效补充了5×5等效感受野的上下文信息,从而显著增强了细长目标的连贯性表达与局部噪声抑制能力。

2.1.3 Align-PAFPN特征融合

YOLOv11n的颈部网络采用PAFPN结构进行多尺度特征融合。然而,上/下采样与逐点融合操作隐含着特征对齐误差:尺度变换引起的插值与采样偏移会导致同一空间位置在不同层级中出现语义“错位”与细节稀释,严重损害油菜角果这类密集小目标的可分辨性。为缓解此问题,本研究在经典PAFPN基础上引入特征对齐机制,构建Align-PAFPN(Aligned Path Aggregation Feature Pyramid Network)颈部网络(如图3所示)。受文献21启发,该结构在不改变原有拓扑关系的前提下,在跨尺度分支上显式引入了轻量对齐单元:采用ESD及SNI模块,分别替换原有融合过程中的上采样和下采样。这一改进使得不同尺度特征在融合前具有更一致的空间对应关系,从而提升跨尺度融合的稳定性与小目标的表征质量。

2.1.4 YOLOv11n-A3架构小结

表1给出基线YOLOv11n与YOLOv11n-A3的结构差异,主要集中在颈部网络引入了A2,以及重构了特征融合路径。
表1 基线YOLOv11n与YOLOv11n-A3的结构对比

Tab. 1 Architecture comparison between baseline YOLOv11n and YOLOv11n-A3

路径/位置 基线模块 本研究模块 说明
P5→P4上采样 nn.Upsample SNI 替换top-down上采样,降低直接最近邻上采样带来的特征对齐偏差
P4融合 C3k2 A2C2f 在P4特征融合后引入A2C2f,增强融合特征的区域/上下文建模能力
P4→P3上采样 nn.Upsample SNI 替换第二个top-down上采样,改善小目标路径中的特征对齐
P3融合 C3k2 A2C2f+TMC 在小目标P3路径上先用A2C2f增强融合特征,再用TMC进一步引入多尺度上下文
P3→P4回流下采样 Conv(stride=2) ESD 在bottom-up/PAN回流中用ESD替代普通步长卷积,补偿下采样过程的信息损失
P4回流融合 C3k2 A2C2f 回流到P4后继续用A2C2f强化特征交互
P4→P5回流下采样 Conv(stride=2) ESD 第二个bottom-up下采样替换为ESD,增强尺度转换时的特征保留
P5融合 C3k2 C3k2 该位置保持vanilla结构不变
Detection head Detect(P3, P4, P5) Detect(P3, P4, P5) 检测头保持不变
表1所示,从研究方法的角度看,这种设计具有两点优势:
1)可复现性与可回滚性。
模型主体拓扑与检测头接口保持不变,但在末端集成了C2PSA,无需修改数据预处理与标签分配等外围流程,避免了潜在干扰变量。同时,新增模块可随时平滑回退至基线结构,从而保障实验对比的公平性与结构变量的可控性。
2)权重迁移的工程可行性。
局部替换未改变网络特征图的尺度传递逻辑,使改进模型能直接加载YOLOv11n的预训练权重进行初始化。这一高度兼容性有效降低了从零训练的收敛难度与计算成本,大幅缩短算法在农业端侧设备上的部署与验证周期。

2.2 实验设置

2.2.1 实验环境与参数设置

模型的训练与测试过程均在Ubuntu 22.04LTS工作站环境下完成。硬件方面,Intel Xeon Platinum 8259 L系列处理器(主频约2.5 GHz),配置4vCPU与16 GB运行内存,并配备1块NVIDIA T4 Tensor Core GPU(16 GB显存)。软件方面,基于PyTorch 2.5.0深度学习框架搭建完整开发平台。编程语言采用Python 3.11。训练策略方面,学习率设置为0.002,采用Adam优化器,固定随机种子为1 337,输入图像尺寸统一调整为960×960像素,整个训练过程共设定100轮,并采用早停策略:当验证集指标在连续30轮内未获得提升时停止训练,批次大小为8,其他超参数沿用默认设置,并最终基于测试集数据统计模型性能指标。

2.2.2 评价指标

在角果检测中,采用精确率(precision, P)、召回率(recall, R)、F 1分数(F 1-Score, F 1)、平均精度均值(mAP0.5、mAP0.5-0.95)评估模型的检测精度;同时选取参数量(Params)、计算量(Giga Floating-point Operations Per Second, GFLOPs)、检测速度(Giga Floating-point Operations, FPS)作为轻量化与端侧部署潜力的评价指标。在角果计数中,选用平均绝对误差(Mean Absolute Error, MAE)、均方根误差(Root Mean Squared Error, RMSE)、平均绝对百分比误差(Mean Absolute Percentage Error, MAPE)、决定系数(Coefficient of Determination, R 2)作为计数结果的量化指标。
本研究评价指标均基于目标检测框级匹配进行统计,而非像素级度量。在验证阶段,模型首先以较低置信度阈值(conf=0.001)保留候选检测框,以构建完整的Precision-Recall曲线;随后执行非极大值抑制(Non-Maximum Suppression, NMS),其中IoU阈值设为0.7,并限制每张图像的最大检测数量为300。在完成候选框筛选后,预测框与同类别标注框依据IoU阈值进行一一匹配,在不同置信度截断下统计真阳性(TP)、假阳性(FP)与假阴性(FN),从而计算对应的P与R。FPS基于验证集图像逐张推理的平均耗时换算,用于比较不同模型的推理速度。

2.2.3 损失函数

采用复合型目标检测损失函数,对边界框回归、类别预测、分布式回归进行联合优化。整体损失函数的计算如公式(1)所示。
= λ b o x b o x + λ c l s c l s + λ d f l d f l
式中: b o x c l s d f l分别表示边界框回归损失、分类损失、分布式焦点损失; λ b o x λ c l s λ d f l分别表示上述三项损失对应的权重系数,分别设定为12.0、0.5、1.5。
设一张图像中共有N个正样本,对于第 i个正样本,其预测边界框表示为 b ^ i = ( x ^ i , y ^ i , w ^ i , h ^ i ),对应的真实边界框表示为 b i = ( x i , y i , w i , h i )。记该正样本的类别预测概率为 p ^ i,真实类别标签为 y i。在单类别检测任务中, y i { 0,1 }。对于全部候选位置,记第 j个位置的目标置信度预测为 o ^ j,其对应监督标签为 o j { 0,1 },其 o j = 1表示前景, o j = 0表示背景。设全部候选位置数为 M
边界框回归损失用于约束预测框与真实框之间的几何一致性。采用CIoU损失表示,计算如公式(2)公式(3)所示。
b o x = 1 N i = 1 N 1 - C I o U ( b ^ i , b i )
C I o U ( b ^ i , b i ) = I o U ( b ^ i , b i ) - ρ 2 ( ( x ^ i , y ^ i ) , ( x i , y i ) ) c i 2 - α i v i
式中: ρ表示两个边界框中心点之间的欧氏距离; c i表示同时包围预测框与真实框的最小外接框对角线长度; v i表示宽高比一致性项; α i为对应的权重系数。
分类损失用于衡量类别预测结果与真实标签之间的差异。本研究采用二元交叉熵损失计算,如公式(4)所示。
c l s = - 1 N i = 1 N y i l o g   ( p ^ i ) + ( 1 - y i ) l o g   ( 1 - p ^ i )
为了进一步提升边界框回归的精细度,本研究引入分布式焦点损失。其基本思想是将连续坐标回归转化为离散分布学习。设第 i个正样本在边 k上的连续监督目标记为 t i k,其中 k { l , t , r , b }分别表示左、上、右、下四个方向;设该边对应的离散预测分布为 s ^ i k。分布式焦点损失计算如公式(6)所示。
d f l = 1 4 N i = 1 N k l , t , r , b t i k - t i k c e S ^ i k , t i k + t i k - t i k c e S ^ i k , t i k
式中: c e表示交叉熵损失; t i k t i k分别表示 t i k的下取整和上取整。该损失通过对相邻离散位置进行加权监督,使模型能够以分布预测的方式逼近连续回归目标,从而提高边界框回归的细粒度表达能力和训练稳定性。当模型未启用该分支时,可令 λ d f l = 0
综上,本研究通过边界框回归损失、分类损失和分布式焦点损失的加权组合,对目标检测任务进行联合优化。其中, b o x用于提升定位精度, c l s用于增强类别判别能力, d f l则进一步增强边界框回归的细粒度建模能力。

3 结果与分析

3.1 不同检测模型综合对比试验

为进一步验证改进后模型YOLOv11n-A3的优越性,使用测试集数据,将其与EfficientDet、实时检测Transformer(Real-Time DEtection TRansformer, RT-DETR)、YOLOv8n和基线模型YOLOv11n进行对比分析,各模型实验结果如图7所示。
图7 YOLO系列模型训练对比图

Fig. 7 Comparison of training curves for YOLO series models

表2可知,YOLOv11n-A3在精确率、召回率、mAP0.5-0.95分别达到了92.6%、85.1%、47.1%,较基线模型分别提高了1.8、2.5、12.5个百分点。与EfficientDet、RT-DETR、YOLOv8n相比,YOLOv11n-A3的mAP0.5分别高出9.9、2.1、12.4个百分点,精确率分别高出9.5、2.0、6.7个百分点,F1分数分别高出8.1、0.4、7.6个百分点;在更为严格的mAP0.5-0.95和召回率上,YOLOv11n-A³仅次于RT-DETR。究其结构差异,RT-DETR依托Transformer的全局自注意力机制,在全局上下文捕获与高阈值定位上优势显著;而YOLOv11n-A3虽有A2加持,但受CNN局部感知局限,全局建模能力略逊一筹。
表2 油菜角果实验结果对比

Tab. 2 Comparison of experimental results for rapeseed siliques

模型 mAP0.5/% mAP0.5-0.95/% 精确率/% 召回率/% F 1分数/% 参数量/M 计算量/GFLOPs 检测速度/(帧/s) MAE/个 MAPE/% R 2 RMSE/个
EfficientDet 83.4 44.8 83.1 78.3 80.6 6.60 6.10 533.3 5.12 17.64 0.732 7.6
RT-DETR 91.2 50.6 90.6 86.0 88.3 32.81 107.99 272.1 3.91 16.01 0.864 5.4
YOLOv8n 80.9 22.6 85.9 76.9 81.1 3.01 8.19 968.0 2.47 11.13 0.944 3.5
YOLOv11n 90.6 34.6 90.8 82.6 86.5 2.59 6.44 852.9 2.55 11.05 0.942 3.6
YOLOv11n-A3 93.3 47.1 92.6 85.1 88.7 2.58 6.39 625.3 2.61 11.37 0.937 3.7
然而,得益于CNN架构高效的归纳偏置,YOLOv11n-A3在模型轻量化方面优势明显,其参数量仅为2.58 M,计算量也保持在6.39 GFLOPs的较低水平。与EfficientDet、RT-DETR和YOLOv8n相比,其参数量分别大幅减少了60.9%、92.1%和14.3%,计算量较RT-DETR的107.99 GFLOPs骤降了94.1%。在检测速度方面,YOLOv11n-A3的检测速度达到了625.3帧/s,单图处理帧率虽略低于基线YOLOv11n与YOLOv8n,但其检测速度是RT-DETR的2.3倍。在角果计数方面,YOLOv11n-A3的MAE、RMSE、MAPE及R 2分别为2.61个、3.7个、11.37%和0.937,计数精度显著优于EfficientDet与RT-DETR;尽管受轻量化结构限制,其回归误差较YOLOv8n略有微幅增加,但整体依然保持了较高的计数精准度与稳定性。综上分析,YOLOv11n-A3在检测精度、计数准确性与计算开销之间取得了较好的平衡,充分展现了其轻量高效的优越性,更适用于边缘移动设备上的油菜微小果喙实时检测计数任务。

3.2 消融实验

为验证各改进模块对模型性能的贡献,在保持训练参数一致的条件下,依次引入TMC、Align-PAFPN和A2模块进行消融实验,共设置8组对比试验,结果如表3所示。
表3 YOLOv11n-A3消融实验结果

Tab. 3 Ablation study results of YOLOv11n-A3

模型 TMC

Align-

PAFPN

A2 mAP0.5/% mAP0.5-0.95/% 精确率/% 召回率/% F 1分数/% MAE/个

MAPE

/%

R 2

RMSE

/个

Baseline × × × 90.6 34.6 90.8 82.6 86.5 2.55 11.05 0.94 3.60
TMC × × 90.8 33.0 91.8 82.2 86.7 2.77 11.62 0.92 4.17
Mono-A × × 92.6 38.6 92.6 83.9 88.0 3.30 15.02 0.91 4.37
Dual-A × × 92.0 49.0 91.9 83.6 87.6 2.56 10.74 0.94 3.65
TMC-A × 92.6 37.0 91.9 84.7 88.2 2.27 9.77 0.94 3.47
Sub A3 × 92.1 46.0 92.0 83.1 87.3 2.71 11.38 0.93 3.98
TMC-A2 × 91.2 28.2 91.9 83.1 87.3 3.15 14.51 0.91 4.34
A3 93.3 47.1 92.6 85.1 88.7 2.61 11.37 0.94 3.70

注:√表示添加模块;×表示未添加模块。列1模型代号仅作本章节讨论之宜。

表3可知,以Baseline为基准,仅引入上下文增强的TMC后,mAP0.5与精确率出现小幅提升,但mAP0.5-0.95略有回落,表明该模块对分类判别稳定性具有一定增强作用,但也对微小果喙的精细边界回归产生了干扰,削弱了高IoU阈值下的定位精度。当仅引入对齐融合的Align-PAFPN时,mAP0.5与mAP0.5-0.95均获得明显提升,说明对齐后的多尺度特征融合机制有助于提升预测框的几何一致性,从而在更严格的匹配阈值下仍能保持较高性能。当仅引入A2模块后,mAP0.5-0.95提升更为显著,表明A2在增强高分辨率特征表达能力的同时,有助于提升小目标的精细定位能力。
在组合结构中,TMC-A相较于单模块配置在召回率与F1分数上表现更为稳健,说明上下文增强与对齐融合之间存在一定互补关系。值得注意的是,缺乏Align-PAFPN对齐的TMC-A2模型mAP0.5-0.95骤降至28.2%,表明TMC的多尺度特征与A2的局部特征极易产生空间错位与拮抗。由此反证,Align-PAFPN是消除特征冲突、协同释放模块增益的关键条件。
最终,虽然完整组合模型A3的mAP0.5-0.95较Dual-A略有回落,但其在mAP0.5、精确率、召回率及F 1分数等指标上均达到了最优状态,较基线模型分别提高2.7、1.8、2.5、2.2个百分点。表明当TMC、Align-PAFPN与A2同时启用时,模型能够在判别可靠性与定位精度之间达到平衡,从而验证了整体结构设计的合理性与有效性。
此外,在角果计数性能方面,各模块组合的R 2均稳定在0.91~0.94之间,展现出可靠的拟合能力。其中,TMC-A取得了最低的绝对误差。最终的A3模型虽然在计数误差上存在极微小的波动,但其在维持高精度计数的前提下,换取了目标定位精度的显著突破,在检测鲁棒性与计数稳定性之间实现了平衡。

3.3 测试结果可视化

将数据集的真实标注和YOLOv11n模型检测结果,以及YOLOv11n-A3模型检测结果进行可视化,如图8所示。
图8 油菜角果目标检测效果可视化对比

注:黄色圆圈表示误检的油菜角果;红色箭头表示漏检的油菜角果。

Fig. 8 Visual comparison of rapeseed silique detection results

图8可见,YOLOv11n在检测分枝油菜角果时存在较明显的漏检与误检现象,主要表现为对杂质、角果柄的误检,重复识别,以及对交叉、重叠、遮挡角果的漏检。相比之下,改进后的YOLOv11n-A3模型在各类角果分布的检测精度与稳定性方面均有显著提升,表现出更优的目标定位能力和更高的置信度分布。

3.4 改进YOLOv11n模型在油菜角果计数中的应用

3.4.1 模型部署与应用

基于Django框架开发了油菜育种人工智能(Artificial Intelligence, AI)工具(图9),该系统由小程序与后台管理平台构成。移动端获取油菜分枝原生图像后,系统通过Letterbox预处理策略将图像像素缩放至960×960,加载ONNX格式模型直接在移动端执行离线推理。经置信度过滤与NMS后,移动端即时渲染识别结果,并将其通过超文本传输安全协议(Hypertext Transfer Protocol Secure, HTTPS)异步提交至云端服务器,统一存储于开源关系型数据库(Postgre Structured Query Language, PostgreSQL)。田间移动端实测数据表明,该系统单图端侧推理耗时为0.2~0.4 s,有效满足了实际考种的低延迟应用需求。
图9 油菜育种AI工具

Fig. 9 AI tool for rapeseed breeding

3.4.2 模型应用测试

为进一步检验油菜育种AI工具在实际应用上的有效性和稳定性,本研究在田间随机剪取4个油菜分枝,并分别置于室内关灯、室内开灯、室外遮阴处以及田间4种场景下,具体图例见图1。采用搭载YOLOv11n-A3模型的移动端小程序进行实地实景验证。不同场景下的计数测试结果如表4所示。试验表明该计数策略与人工计数结果相近,证实了本方法的有效性。
表4 不同场景下油菜分枝样本角果计数结果汇总

Tab. 4 Summary of silique counting results for rapeseed branch samples under different scenarios

测试场景 样本总数/个 人工计数/个 模型计数/个 差值/个 MAE/个 MAPE/%
室内开灯 4 271 270 -1 0.19 0.23
室内关灯 4 271 272 1
田间 4 271 271 0
室外 4 271 270 -1

注:测试涵盖4个密度梯度的真实分枝样本(分别含40、58、74、99个角果),移动端单图推理时间均稳定在0.3 s。

4 结 论

为解决油菜离体考种中因角果密集重叠及果喙微小引发的精准计数难题,本研究提出一种基于YOLOv11n-A3的检测与计数方法。针对油菜角果目标特点,在主干网络集成SPPF与C2PSA以强化特征的多维联合表达,并在颈部构建融合A2的Align-PAFPN架构,从而协同缓解空间信息错位并提升区域上下文交互能力。实验结果表明,模型精确率、召回率、mAP0.5-0.95分别达92.6%、85.1%、47.1%,较基线模型分别提高了1.8、2.5、12.5个百分点;且计算量为6.39 GFLOPs,参数量为2.58 M,检测速度达625.3 帧/s;同时,模型在角果计数任务中展现出优异的拟合精度,R 2达0.937,MAE仅为2.61个。本研究在维持低计数误差的前提下,大幅提升了复杂遮挡场景下的目标定位精度,为油菜角果检测与计数提供了高效、轻量化的技术支撑。此外,为满足田间实时考种的应用需求,本研究将轻量化模型封装并部署于自主开发的油菜育种AI工具中,可实现对油菜角果的快速精准计数,有效验证了所提轻量化算法在端侧设备上的工程应用潜力。
YOLOv11n-A3虽然在检测和计数任务中取得了较好的效果,但在极端遮挡与高密度簇生场景中仍有提升空间,未来研究拟引入多模态数据融合或多视角特征匹配机制,实现油菜整株角果的检测与计数。

本研究不存在研究者以及与公开研究成果有关的利益冲突。

[1]
李殿荣, 李永红, 王灏, 等. 杂交油菜再高产的育种途径[J/OL]. 西北农业学报. (2025-10-17) [2025-11-14].

LI D R, LI Y H, WANG H, et al. Breeding approaches for even higher productivity in hybrid rapeseed[J/OL]. Acta Agriculturae Boreali-occidentalis Sinica. (2025-10-17) [2025-11-14].

[2]
黄郢, 赵培森, 谢伶俐, 等. 长江流域冬油菜品种产量构成及育种策略分析[J]. 中国油料作物学报, 2024, 46(1): 13-18.

HUANG Y, ZHAO P S, XIE L L, et al. Analysis on yield composition and breeding strategy of winter rape varieties in the Yangtze River Basin[J]. Chinese Journal of Oil Crop Sciences, 2024, 46(1): 13-18.

[3]
周云成, 张羽, 刘泽钰, 等. 基于深度学习的稻粒在穗计数方法研究[J]. 沈阳农业大学学报, 2025, 56(1): 82-91.

ZHOU Y C, ZHANG Y, LIU Z Y, et al. Study on counting method of on panicle rice grains based on deep learning[J]. Journal of Shenyang Agricultural University, 2025, 56(1): 82-91.

[4]
徐胜勇, 卢昆, 潘礼礼, 等. 基于RGB-D相机的油菜分枝三维重构与角果识别定位[J]. 农业机械学报, 2019, 50(2): 21-27.

XU S Y, LU K, PAN L L, et al. 3D reconstruction of rape branch and pod recognition based on RGB-D camera[J]. Transactions of the Chinese Society for Agricultural Machinery, 2019, 50(2): 21-27.

[5]
谢忠红, 黄一帆, 吴崇友. 基于ISS-LCG组合特征点的油菜分枝点云配准方法[J]. 华南农业大学学报, 2023, 44(3): 456-463.

XIE Z H, HUANG Y F, WU C Y. Point cloud registration method of rape branches based on ISS-LCG combined feature points[J]. Journal of South China Agricultural University, 2023, 44(3): 456-463.

[6]
LIU J J, ZHOU B, LIU J, et al. KAN-GLNet: an enhanced PointNet++ model for canola silique segmentation and counting[J]. PLoS One, 2025, 20(11): e0336622.

[7]
陈韬, 徐爱俊, 周素茵, 等. 基于改进P2PNet的猪只计数方法[J]. 农业工程学报, 2025, 41(11): 209-218.

CHEN T, XU A J, ZHOU S Y, et al. Method for counting pigs using improved P2PNet[J]. Transactions of the Chinese Society of Agricultural Engineering, 2025, 41(11): 209-218.

[8]
孙守鑫, 孙一鸣, 张峰, 等. 基于无人机图像和MSA-TCN模型的山区烟株计数[J]. 农业工程学报, 2025, 41(21): 146-154.

SUN S X, SUN Y M, ZHANG F, et al. Counting tobacco plants in hilly areas using UAV imagery and MSA-TCN model[J]. Transactions of the Chinese Society of Agricultural Engineering, 2025, 41(21): 146-154.

[9]
刘晓君, 吴茜, 孙传亮, 等. 基于改进MobileViT模型的水稻病害识别算法与系统研发[J]. 智慧农业(中英文), 2026, 8(1): 28-39.

LIU X J, WU Q, SUN C L, et al. Rice disease identification method based on improved MobileViT model and system development[J]. Smart Agriculture, 2026, 8(1): 28-39.

[10]
薛卫, 程润华, 康亚龙, 等. 基于GC-Cascade R-CNN的梨叶病斑计数方法[J]. 农业机械学报, 2022, 53(5): 237-245.

XUE W, CHENG R H, KANG Y L, et al. Pear leaf disease spot counting method based on GC-cascade R-CNN[J]. Transactions of the Chinese Society for Agricultural Machinery, 2022, 53(5): 237-245.

[11]
VIJAYAKUMAR A, VAIRAVASUNDARAM S. YOLO-based object detection models: A review and its applications[J]. Multimedia Tools and Applications, 2024, 83(35): 83535-83574.

[12]
KHANAM R, HUSSAIN M. YOLOv11: An overview of the key architectural enhancements[EB/OL]. arXiv: 2410.17725, 2024.

[13]
SWATHI Y, CHALLA M. YOLOv8: Advancements and innovations in object detection[C]// Smart Trends in Computing and Communications. Cham, Germany: Springer, 2024: 1-13.

[14]
姚晓通, 曲绍业. 基于改进YOLOv12s的辣椒叶片病虫害轻量化检测方法[J]. 智慧农业(中英文), 2026, 8(1): 1-14.

YAO X T, QU S Y. Lightweight detection method for pepper leaf diseases and pests based on improved YOLOv12s[J]. Smart Agriculture, 2026, 8(1): 1-14.

[15]
黄志豪, 卢承方, 崔艳荣, 等. YOLO-AP: 基于改进YOLO11n的轻量级苹果果实检测算法[J]. 中国农业科技导报, 2025, 27(10): 118-133.

HUANG Z H, LU C F, CUI Y R, et al. YOLO-AP: a lightweight apple fruit detection algorithm based on improved YOLO11n[J]. Journal of Agricultural Science and Technology, 2025, 27(10): 118-133.

[16]
李尚平, 刘建举, 王恒, 等. 基于YOLO 11n-EWL的甘蔗芽检测方法[J]. 农业机械学报, 2025, 56(11): 471-479.

LI S P, LIU J J, WANG H, et al. Sugarcane bud detection method based on YOLO 11n-EWL[J]. Transactions of the Chinese Society for Agricultural Machinery, 2025, 56(11): 471-479.

[17]
CARION N, MASSA F, SYNNAEVE G, et al. End-to-end object detection with transformers[C]// Computer Vision – ECCV 2020. Cham, Germany: Springer, 2020: 213-229.

[18]
SAPKOTA R, KARKEE M. Ultralytics YOLO evolution: An overview of YOLO 26, YOLO11, YOLOv8 and YOLOv5 object detectors for computer vision and pattern recognition[EB/OL]. arXiv: 2510.09653, 2025.

[19]
LI Y, KAISER L, BENGIO S, et al. Area attention[C]// International conference on machine learning. New York, USA: PMLR, 2019: 3846-3855.

[20]
JIN Y, TIAN X Y, ZHANG Z, et al. C2F: An effective coarse-to-fine network for video summarization[J]. Image and Vision Computing, 2024, 144: 104962.

[21]
LI H L. Rethinking features-fused-pyramid-neck forObject detection[C]// Computer Vision – ECCV 2024. Cham, Germany: Springer, 2025: 74-90.

文章导航

/