欢迎您访问《智慧农业(中英文)》官方网站! English

融合SimAM与四尺度检测的YOLOv11荷斯坦奶牛姿态估计

  • 刘思伊 1 ,
  • 李振波 , 1, 2
展开
  • 1. 中国农业大学信息与电气工程学院,北京 100083,中国
  • 2. 农业农村部信息化标准化重点实验室,北京 100083,中国
李振波,博士,教授,研究方向为计算机视觉。E-mail:

刘思伊,本科,研究方向为计算机视觉。E-mail:

收稿日期: 2026-04-28

  网络出版日期: 2026-07-17

基金资助

国家重点研发计划课题(2024YFD2000304)

现代农业产业技术体系北京市智慧农业创新团队岗位专家项目(BAIC10-2026-E14)

Holstein Cattle Pose Estimation via YOLOv11 with Integrated SimAM and Four-Scale Detection

  • LIU Siyi 1 ,
  • LI Zhenbo , 1, 2
Expand
  • 1. College of Information and Electrical Engineering, China Agricultural University, Beijing 100083, China
  • 2. Key Laboratory of Standardization of Agricultural Informatization, Beijing 100083, China
LI Zhenbo, E-mail:

LIU Siyi, E-mail:

Received date: 2026-04-28

  Online published: 2026-07-17

Supported by

National Key Research and Development Program of China(2024YFD2000304)

Post Expert Project of the Beijing Smart Agriculture Innovation Team, Modern Agriculture Industry Technology System(BAIC10-2026-E14)

Copyright

copyright©2026 by the authors

摘要

【目的】 荷斯坦奶牛养殖环境存在光照复杂、遮挡多等干扰因素,且现有AI模型对奶牛蹄部、耳尖等末端关键点表征不足,导致姿态估计精度不高。为提高复杂牛舍场景下奶牛姿态估计的精度与鲁棒性,以YOLOv11n-Pose为基础模型,提出一种融合自适应注意力与多尺度感知的轻量化奶牛姿态估计算法YOLOv11n-AS4D。 【方法】 针对蹄部、耳尖等末端关键点因多级下采样导致的空间信息衰减,设计基于P2高分辨率特征的非对称四尺度检测头,通过渐进式通道配置与单向特征流提升细粒度空间表征能力;针对遮挡与背景纹理相似条件下特征判别不稳定问题,提出Adaptive SimAM模块,通过自适应正则化、多尺度能量建模与层级差异化部署增强关键点特征的判别稳定性。 【结果】 改进模型在自建与CMBN数据集上的精确率为97.6%和98.0%,召回率为97.6%和98.7%,mAP@0.5:0.95为84.6%和83.8%,较YOLOv11n-Pose的mAP@0.5:0.95分别提升1.2和1.4个百分点,精确率分别提升0.4和0.3个百分点,召回率分别提升0.4和0.5个百分点;参数量由2.90/2.91 M降至2.27/2.28 M;计算量由7.3/7.2增至9.8 GFLOPs,端到端推理速度为83.1帧/s,表明模型以一定计算开销换取更高定位精度,并保持实时推理能力。 【结论】 该模型以适度增加计算量为代价,降低了参数量并提升了姿态估计精度,有效缓解了末端关键点空间信息衰减与复杂遮挡下的特征判别不稳定,可为奶牛行为识别与养殖管理提供骨架感知支撑。

本文引用格式

刘思伊 , 李振波 . 融合SimAM与四尺度检测的YOLOv11荷斯坦奶牛姿态估计[J]. 智慧农业, 2026 : 1 -16 . DOI: 10.12133/j.smartag.SA202604052

Abstract

[Objective] In large-scale Holstein farms, accurate pose estimation remains difficult because images are affected by complex illumination, occlusions caused by facilities and neighboring individuals, and local similarity between black-and-white coat patterns and barn textures, which weaken feature discrimination and reduce keypoint localization reliability. Distal keypoints, especially hoof keypoints, are particularly affected. Existing lightweight models meet real-time requirements but have insufficient representational ability for these small distal keypoints under occlusion and background interference. To improve distal keypoint localization while keeping the model compact and real-time, a lightweight Holstein cattle pose estimation algorithm, YOLOv11n-AS4D, was proposed based on YOLOv11n-Pose by integrating adaptive attention with multi-scale perception. [Methods] Two complementary improvements were introduced. First, an asymmetric four-scale detection head based on P2 high-resolution features was constructed to compensate for the spatial information loss of small distal keypoints during repeated downsampling. Compared with conventional three-scale structures, the added P2 branch (stride 4) provides a higher-resolution feature layer that retains shallow spatial details for final keypoint prediction. To control the extra cost of this high-resolution branch, three coordinated strategies were adopted: a unidirectional feature flow, in which the P2 branch only received deep semantic features for prediction and was not propagated back into the bottom-up aggregation path, thereby suppressing shallow noise transmission; a progressive channel configuration, with 64, 128, 256, and 512 channels for P2 to P5, which kept the main convolutional cost of each scale at a comparable level; and depthwise separable convolution in the aggregation path to further reduce computation. Second, an Adaptive SimAM module was proposed to improve feature discrimination under occlusion and texture interference. Unlike the original SimAM with a fixed regularization coefficient and a single-scale response, it introduced three extensions: adaptive regularization, which generated a sample-level coefficient from a global feature descriptor to adjust the attention response to the current feature distribution; multi-scale energy modeling, which combined multi-receptive-field pooling with a Sobel-based edge prior to jointly capture local residual texture and larger-scale context; and hierarchical deployment, which inserted the module after the P2, P3, and P4 stages of the backbone and at the P3 scale of the neck according to their functional roles. The model was trained and evaluated separately on a self-constructed Holstein cattle pose dataset and the public CMBN dataset to examine scene adaptability and generalization. [Results and Discussions] On the self-constructed and CMBN datasets, YOLOv11n-AS4D achieved 97.6% and 98.0% precision, 97.6% and 98.7% recall, and 84.6% and 83.8% mAP@0.5:0.95, respectively. Compared with YOLOv11n-Pose, mAP@0.5:0.95 increased by 1.2 and 1.4 percentage points, precision increased by 0.4 and 0.3 percentage points, and recall increased by 0.4 and 0.5 percentage points, respectively,,indicating improved localization under stricter thresholds. The number of parameters decreased from 2.90/2.91 M to 2.27/2.28 M, while computational cost increased from about 7.3/7.2 GFLOPs to 9.8 GFLOPsand the end-to-end inference speed reached 83.1 f/s, showing that accuracy was improved at a moderate computational cost while real-time inference was maintained. Ablation experiments showed that the two modules were complementary rather than redundant. Their joint gains in mAP@0.5:0.95 were 1.2 and 1.4 percentage points on the self-constructed and CMBN datasets, respectively, exceeding the summed individual gains on the self-constructed dataset and remaining close to their sum on the CMBN dataset. This indicated that the four-scale detection head and Adaptive SimAM enhanced different aspects of feature representation: fine-scale spatial localization of distal keypoints and feature discrimination under occlusion, respectively. In occlusion robustness tests, , average precision (AP) under severe occlusion increased from 73.5% for YOLOv11n-Pose to 75.9% for YOLOv11n-AS4D, and on continuous video sequences, the keypoint missing rate decreased from 8.73% for the baseline to 1.94% for the proposed model. Per-keypoint analysis showed reduced hoof localization errors, confirming the benefit of high-resolution feature compensation for small distal keypoints. [Conclusions] The proposed YOLOv11n-AS4D improved Holstein cattle pose estimation accuracy under complex farming conditions while reducing the number of parameters, with only a moderate increase in computation. By combining an asymmetric four-scale detection head with Adaptive SimAM, it mitigated spatial information loss of distal keypoints and improved feature discrimination under occlusion, while maintaining real-time inference, thereby providing more reliable skeleton perception for downstream behavior recognition, lameness assessment, and intelligent herd management.

0 引 言

近年来,全球牛存栏量持续增长,规模化养殖对牧场智能管理提出了更高要求。据联合国粮食及农业组织统计数据库(Food and Agriculture Organization Statistical Database,FAOSTAT)数据库统计,2019—2024年全球牛只存栏量由约15.05亿头增至约15.8亿头。荷斯坦奶牛行为变化与健康状态及生产性能密切相关,是开展跛行检测、异常行为识别与健康评估的重要依据12;然而,传统人工巡检耗时耗力、主观性强且漏检风险高,难以实现连续、客观监测3。基于机器视觉的姿态估计能够非接触式提取奶牛骨架关键点,并将图像信息转化为行为分析与健康评估所需的结构化表征,为规模化奶牛状态感知提供有效途径。
在非接触式姿态估计领域,现通用计算机视觉框架已较为成熟,为畜牧应用奠定了人工智能算法基础。OpenPose4与高分辨率网络(High-Resolution Network,HRNet)5等经典模型已在人体姿态估计中验证了其有效性,DeepLabCut6更是通过迁移学习让自定义动物部位的无标记追踪成为可能。但通用模型常伴随着高计算代价,如何在精度与效率之间寻找平衡点成为研究焦点。JIANG等7提出的实时多人姿态估计模型(Real-Time Multi-Person Pose Estimation,RTMPose)在保障精度的同时显著压缩了计算延时,LI等8进一步将其适配至牧场牛只关键点检测场景,在自建牛只和AP-10K测试集上的平均精度分别达到82.9%和72.0%。面对更具挑战的交互与遮挡场景,LIU等9结合解剖先验与多尺度特征机制提升了多动物关键点检测鲁棒性。
与通用姿态估计场景相比,荷斯坦奶牛在真实牛舍环境中的姿态估计面临更强的场景约束。密集饲养条件下的杂乱背景、个体重叠及肢体交错易引发关键点遮挡与结构混淆;同时,黑白斑块纹理与背景区域的局部相似性会增加特征判别难度,而蹄部等小关节与躯干等大尺度部位并存,也对多尺度特征表征与精细定位提出了更高要求10。因此,奶牛姿态估计并非通用动物姿态估计任务的简单迁移,而需针对末端关键点保持和复杂背景下的判别稳定性进行专项设计。WU等11构建了基于改进YOLOv8n与RTMPose的两阶段框架,缓解了多头场景下的遮挡与尺度问题;TAGHAVI等12则利用时序动物姿态估计模型(Temporal LEAP,T-LEAP)提取奶牛步态特征,实现室内牛舍环境下的非接触式运动监测,提升了室内牛舍环境下的识别鲁棒性。WEI等13 通过部分置信图与部分亲和场匹配获取奶牛骨架,并利用骨架时空特征开展状态识别。
现有研究在环境适应性方面取得一定进展,但边缘端算力受限场景下的细粒度特征提取仍缺乏有效方案。BARNEY等14指出复杂背景下蹄部定位精度与推理速度难以兼顾;FAN等15提出多分支自底向上网络增强遮挡特征表征,但其参数量达到14.01 M,模型规模仍偏大,边缘端部署存在一定压力。黄筠竹等16融合空间感知与时序特征提升腿部跟踪稳定性,但推理速度有所下降,说明遮挡鲁棒性提升仍需兼顾实时性约束。基于上述精度与资源约束,近期研究逐渐转向轻量化设计。张欣冉等17提出基于改进YOLOv11n的轻量化模型以应对严重遮挡干扰,其目标关键点相似度(Object Keypoint Similarity,OKS)阈值为0.5时的平均精度均值(mean Average Precision, mAP@0.5)达到95.3%;ZHAO等18则采用重参数化技术结合注意力机制抑制背景噪声并增强蹄部细节特征,OKS阈值为0.5时的平均精度(Average Precision,AP@0.5)到92.3%、参数量为3.11 M,在速度与精度之间寻求折中。
尽管现有研究在检测精度和推理效率上取得了一定进展,但在密集饲养、多源遮挡及体表纹理与背景相似的真实牛舍中,末端微小关键点的精细定位仍具挑战。在轻量化端到端姿态估计框架中,第3级特征金字塔层(feature pyramid level 3, P3)及更深层特征仍是关键点预测的主要信息来源,多级下采样易导致蹄部等末端小尺度关键点空间细节衰减。与此同时,现有注意力方法多基于全局统计、局部响应或固定能量函数进行特征重标定,缺乏对遮挡干扰与层级特征差异的动态适配,难以在复杂养殖场景下保持稳定的特征判别能力。
针对奶牛姿态估计中蹄部、耳尖等微小末端关键点在多级下采样中易发生空间信息衰减,以及遮挡与背景纹理相似条件下特征判别不稳定等问题,本研究以YOLOv11n-Pose为基础框架,从尺度结构补偿与特征自适应增强两个层面进行协同优化:设计基于P2高分辨率特征的非对称四尺度检测头,提升末端关键点的细粒度空间表征能力;提出Adaptive SimAM模块,改善遮挡与背景干扰条件下关键点特征的判别稳定性。为验证算法的泛化能力,分别在开源数据集CMBN15与自建数据集上进行了独立测试。

1 数据集构建

荷斯坦奶牛的非接触式姿态估计受环境因素影响显著,构建包含多种复杂工况的数据集是提升算法性能关键。为确保模型兼具良好的泛化能力与针对性,数据集中需包含不同光照强度、不同拍摄角度,以及存在严重遮挡(如围栏、肢体互遮挡)的样本图像,以解决现有模型在蹄部、耳尖等细小关键点定位不准的问题。基于此,本研究采用了以下两个数据集:FAN等15公开的CMBN数据集以及自采集的奶牛行为数据集。

1.1 开源CMBN数据集

开源CMBN数据集由FAN等15发布(https://github.com/fqcwd/CMBN/tree/main),提供了荷斯坦奶牛和肉牛的关节点标注信息,适用于HRNet5等自下而上的姿态估计模型。经统计,数据集中荷斯坦奶牛与肉牛实例比例约为5∶1,样本以荷斯坦奶牛为主体,与本研究对象具有较高一致性;少量肉牛样本与荷斯坦奶牛具有相同的骨架拓扑结构,其体型与纹理差异可在一定程度上丰富训练数据的特征分布,有助于增强模型对牛只关键点的泛化表征能力。由于本研究采用YOLO系列自顶向下的姿态估计模型,故需对CMBN数据集进行补充检测框标注及格式转换。该数据集包含3 540张训练图像和394张测试图像,涵盖站立、行走、躺卧三类姿态及昼夜光照场景(表1),可作为模型训练与泛化验证的基础数据源。但其拍摄角度相对固定,背景构成较为简单,且对跛行、采食、饮水等行为状态下的姿态样本和多角度、多遮挡场景覆盖不足,可能制约模型对真实养殖环境中复杂姿态的泛化能力与鲁棒性。
表1 CMBN牛只数据集样本划分统计表 ( 张)

Table 1 Statistics of cattle instance splits in the CMBN dataset

行为类别 训练集(白天) 训练集(晚上) 测试集(白天) 测试集(晚上)
站立 628 275 106 60
行走 1 265 805 111 57
躺卧 27 540 24 36
总计 1920 1 620 241 153

1.2 自建奶牛行为数据集

鉴于开源CMBN数据集行为类别单一且对遮挡场景表征不足,难以支撑对精细关键点(如蹄部)及复杂工况的分析需求。本研究构建了高分辨率自建数据集,部分见https://github.com/lsiyi3313-cpu/cowpose

1.2.1 数据采集

采集对象为荷斯坦奶牛,于北京市富农兴牧奶牛养殖中心完成实地数据采集。为增强数据多样性和模型泛化能力,采集过程涵盖了多种复杂场景(图1):不同光照条件(侧光、顺光、逆光、眩光等)、不同拍摄角度(正侧面、斜侧面、俯视等),以及不同遮挡程度(环境设施遮挡、个体间遮挡、无遮挡)的场景。
图1 真实场景下的多视角奶牛姿态样本

Fig.1 Multi-view cow pose samples in real scenarios

1.2.2 数据预处理与标注

使用FFmpeg软件对480条原始视频进行标准化预处理,将每条视频按行为连续性切分为若干3 s片段,减少跨行为片段对后续标注与建模的影响,统一规整为×1 080、30 帧/s的MP4序列,并剔除受光照、视角及模糊干扰的低质片段。针对站立、采食、躺卧、行走、饮水及跛行这6种行为,为解决样本不均衡问题,对高频行为(如站立、采食)剔除冗余以适度削减,对低频行为(如饮水和跛行)则保留所有有效样本,经处理后最终形成包含1 100个视频样本的牛只行为数据集。

1.2.3 关键帧提取与姿态标注

从上述1 100个视频片段中按时间等间隔提取关键帧。本研究以1 s为采样间隔,在每个片段第30帧与第60帧处各抽取1帧,即每片段抽取2帧,共获得2 200帧候选图像;随后剔除运动模糊、牛体不完整及关键点因严重遮挡难以可靠标注的图像,最终保留1 200张原始姿态图像。
采用Labelme软件进行标注(图2),标注内容包括目标边界框及16个骨架关键点,涵盖头部、颈部、脊柱、尾骨,以及左右侧前后肢的腿根、膝、蹄关节。标注工作由课题组3名经过统一培训的研究人员完成,标注前制定关键点定义规范,并经试标注与交叉复核统一标注尺度;标注完成后,对检测框完整性、关键点位置及可见性标记进行人工复核,重点审查遮挡、模糊及姿态变化较大的样本。最后将JSON标注文件转换为YOLO格式。
图2 奶牛图像及其标注结果(16个关键点)对比

注:a. 原始图像 b. 16个关键点标注结果

Fig.2 Comparison of the original cow images and annotation results (16 keypoints)

为避免同源视频相邻帧进入不同子集造成数据依赖,以视频为单位按8∶2比例将1 200张原始姿态图像划分为训练集960张与测试集240张,确保同一视频片段的关键帧全部划入同一子集。针对有限的样本规模,为提升模型泛化能力,仅对训练集实施离线增强:从训练集中筛选约480张关键点对应关系明确、满足镜像条件的图像生成水平翻转样本,并同步修正检测框、关键点坐标,依据骨架左右对称关系交换对应关键点编号,使训练集由960张扩充至1 440张,测试集保持原始240张不变,以缓解小样本条件下的泛化风险。具体见表2,总样本65%存在环境设施遮挡、20%为无遮挡、15%存在个体间相互遮挡;光照条件上侧顺光占52.8%、侧逆光44.1%、正侧光0.6%、正逆光0.9%、眩光1.6%;拍摄角度上正侧面占66%、斜侧面30%、俯视4%。
表2 自建数据集荷斯坦奶牛姿态样本分布与划分统计表 (张)

Table 2 Distribution and split statistics of Holstein dairy cow pose samples in the self-constructed datasett

行为类别 训练集 测试集 行为类别 训练集 测试集
站立 390 60 跛行 130 25
采食 325 50 饮水 75 20
行走 260 45 总计 1 440 240
躺卧 260 40
上述两个数据集在本实验中承担不同的验证职能:CMBN数据集作为公开基准数据集,用于评价模型与已有方法之间的可比性;自建数据集面向真实荷斯坦奶牛养殖场景,重点覆盖多角度拍摄、设施遮挡、牛体互遮挡及饮水、跛行等复杂姿态样本,二者在场景分布上具有互补性。为避免数据合并掩盖不同数据源之间的分布差异,采用双数据集独立训练、独立评估的验证策略,分别在两个数据集内部完成训练集与测试集划分,并分别开展模型训练、测试和消融实验,以两组结果的一致性作为算法泛化能力的实证依据。

2 奶牛姿态估计模型

2.1 整体架构

在真实养殖场景中,奶牛关键点检测面临背景干扰、多源遮挡及末端关键点空间信息易丢失等挑战。本研究以YOLOv11n-Pose为基础框架开展改进:相较于HRNet、OpenPose等热图回归方法,YOLO系列端到端检测与关键点回归框架推理链路简洁,便于边缘端实时部署;相较于YOLOv8-Pose等早期版本,YOLOv11n-Pose在特征提取与多尺度表达方面进行了结构更新;相较于YOLOv12、YOLOv13等较新框架,YOLOv11n结构相对成熟,工程适配性较强,本研究选取YOLOv11n-Pose作为轻量化改进基线。
在此基础上,构建改进模型YOLOv11n-AS4D,整体架构如图3所示。针对蹄部、耳尖等末端关键点因多级下采样所致的空间信息衰减问题,引入P2高分辨率浅层特征,构建覆盖P2~P5的非对称四尺度检测头。针对原始SimAM固定正则系数和单尺度能量响应适应性不足的问题,设计Adaptive SimAM模块,在Backbone多层级输出及Neck融合输出阶段完成层级化部署,实现不同层级特征响应的自适应重标定。模型采用C3k2与跨阶段局部网络(Cross Stage Partial Network,CSP)19完成层级化特征编码,并基于特征金字塔网络(Feature Pyramid Network,FPN20)与路径聚合网络(Path Aggregation Network,PANet)21完成P3~P5多尺度特征交互,P2分支仅单向接收融合特征并参与预测,不参与自底向上特征聚合,形成非对称四尺度预测结构。最终由解耦检测头输出奶牛目标框、关键点坐标及置信度。
图3 YOLOv11n-AS4D模型整体架构

注:黑色箭头表示常规特征传递路径;红色实线箭头表示自底向上PANet聚合路径中DWConv下采样的特征传递;红色虚线箭头表示P2分支的单向接收路径;红色虚线框表示Adaptive SimAM的层级差异化部署位置;Conv为通道降维卷积;Adaptive SimAM为自适应注意力模块;C3k2为复合卷积模块;SPPF为空间金字塔池化模块;C2PSA 为空间注意力特征增强模块;DWConv为深度可分离卷积;Upsample为上采样模块;Concat为特征连接模块;Pose为四尺度姿态检测头;Input表示输入图像。

Fig.3 Overall architecture of the YOLOv11n-AS4D model

2.1.1 基于P2高分辨率特征的非对称四尺度检测头设计

原始YOLOv11姿态估计模型仅采用P3(8×)、P4(16×)和P5(32×)3个尺度特征进行预测,未显式利用stride=4的P2高分辨率特征。在输入像素尺度为640×640的情况下(1 920×1 080经Letterbox等比缩放与边界填充),随着下采样倍数增加,蹄部、耳尖等末端关键点纹理区域小,易与围栏、地面、牛体斑块边缘混叠,空间位置信息随分辨率降低而衰减,进而增大回归偏差22。现有多尺度结构虽已引入浅层特征,但多侧重小目标检测或通用特征融合,较少针对奶牛关键点回归中的浅层噪声传播与边缘端计算约束进行协同设计。
针对上述问题,本研究设计非对称四尺度检测头,引入stride=4的P2高分辨率特征(160×160)补偿末端关键点的浅层空间细节,并通过单向接收流、渐进式通道配置和深度可分离卷积(Depthwise Separable Convolution,DWConv)轻量化设计三项协同约束,控制浅层噪声传播与模型复杂度,满足边缘端部署的推理效率要求。
1)引入P2的浅层特征融合。P2层特征图分辨率像素为160×160,若直接采用全通道融合将显著增加存储与计算开销。为此,在特征融合前引入1×1卷积将P2通道数压缩至64,并采用渐进式通道配置P2=64、P3=128、P4=256、P5=512,使P2层特征规模(160×160×64)与P3层(80×80×128)基本相当。增强后的P2特征可表示为公式(1):
P 2 o u t = C 3 k 2 C o n c a t C o n v 1 × 1 P 2 i n , U p s a m p l e F 3      
式中: P2 out为增强后的P2输出特征; P2 in为P2输入特征; F3 为P3融合后的深层语义特征;Upsample用于将F 3上采样以实现与P2in空间对齐; C o n v ̲ 1 × 1 表示1×1卷积,用于将通道压缩至64;Concat表示通道维度拼接;。C3k2用于融合特征重整,具体的特征融合与P2检测头结构见图4。此外,本研究采用通道拼接(Concat)替代逐元素相加(Add)进行特征融合,以保留浅层细粒度空间信息与深层语义的独立表达,再经C3k2完成自适应整合。
图4 P2检测头结构

Fig.4 Structure of the P2 detection head

2)自底向上特征聚合。P2层特征图分辨率过高,若将其纳入自底向上路径的迭代计算会引入显著计算冗余,且浅层特征中的背景噪声易干扰深层语义表达。为此,在自底向上路径中阻断P2传递,使P2仅作为单向接收端融合深层语义并直接输出。自底向上聚合路径起始于P3层,依次将空间语义信息传递至P4与P5层,形成用于最终检测的多尺度输出序列。聚合过程表示为公式(2):
F i b u = C o n c a t F i - 1 b u , D W C o n v F i t d        
式中: F i - 1 b u表示自底向上路径中上一层输入特征; F i t d表示自顶向下路径中第i层对应特征;DWConv表示步长为2的深度可分离下采样卷积;Concat代表通道拼接操作。
相较于固定的最大池化操作,可学习的卷积下采样在降低空间分辨率的同时能够显式建模局部邻域结构,使关键点相关的梯度信息在尺度转换过程中得到更充分的保留,从而减少蹄部、耳尖等末端关键点在自底向上路径中的空间定位偏差。
3)非对称四尺度检测架构与结构化轻量化设计。针对奶牛关键点尺度跨度大、蹄部与耳尖等末端关键点易在深层下采样中丢失空间细节的问题23,在检测头侧构建覆盖P2~P5的非对称四尺度检测头。P2高分辨率特征虽可补偿末端关键点的空间信息衰减,但会引入额外计算开销。为兼顾细粒度表征与模型效率,P2分支仅作为单向接收端参与预测,不参与后续自底向上特征聚合;各尺度采用渐进式通道配置,P2、P3、P4、P5的通道数分别设为64、128、256、512。该配置使分辨率逐级减半、通道数逐级翻倍。若仅考虑同类型3×3卷积项,其计算量近似正比于 H i W i C i 2,故各尺度分支的主要卷积计算量可维持在同一量级。将P2分支通道数控制为64,既保留浅层细节表达能力,又抑制高分辨率分支的计算膨胀。P3~P5的通道设置沿用YOLOv11n-Pose原有多尺度预测分支配置,以减小结构改动对预训练权重迁移的扰动。各尺度检测头输出张量可描述为其中:Yi 为第i个尺度检测头的输出特征; Y i R H i × W i × C + 4 + 3 K i { 2,3 , 4,5 }。其中, Y i 为第i个尺度检测头的输出特征; H i × W i表示i个尺度特征图的空间分辨率;在640×640的输入尺寸下,P2、P3、P4、P5对应的分辨率分别为160×160、80×80、40×40和20×20;C、4、K分别表示类别置信度、边界框回归参数和关键点数量。
为控制四尺度扩展带来的额外计算开销,P2分支采用轻量化C3k2模块(通道缩放因子0.25),自底向上路径中的P3→P4和P4→P5采用深度可分离卷积(DWConv)替代标准卷积。DWConv将空间特征提取与通道融合解耦,其与标准卷积(StdConv)的计算复杂度比值可近似表示为公式(3):
F L O P s D W C o n v F L O P s S t d C o n v 1 C o u t + 1 k 2        
式中: F L O P s 表示理论浮点运算次数; C o u t为卷积输出通道数;k为卷积核尺寸。公式(3)在输入输出通道数相等时成立,本研究自底向上路径中DWConv均满足此条件。当k=3且 C o u t较大时,主要由1/k 2主导,此时DWConv的计算开销近似降至标准卷积的1/9。以本研究自底向上路径为例,P3→P4与P4→P5阶段输出通道数均为256,DWConv与标准卷积的计算量比值均约为0.115,相比标准卷积降低计算开销约88.5%,有效控制了多尺度路径的计算冗余。因此,采用DWConv可在保持多尺度特征聚合能力的同时有效约束整体理论计算复杂度。
4)验证实验。尽管数据集中所有目标奶牛按常见物体上下文数据集(Common Objects in Context, COCO)目标尺度24定义均被划分为Large类别。但受拍摄距离、生长阶段和姿态变化影响,关键点尺度与可见性仍存在差异,因此进一步开展分场景与分关键点验证。为此,采用基于面积分位数的尺度划分策略,将目标按边界框面积排序并划分为3个区间(表3),可知引入P2浅层高分辨率特征后,AP_small由85.1%提升至85.8%,AP_medium由89.8%提升至89.9%,AP_large由86.4%提升至86.8%,AP(all)由83.4%提升至83.8%,说明P2高分辨率特征对小尺度目标和整体定位精度均具有促进作用。
表3 引入P2前后在不同尺度目标上的精度对比

Table 3 Accuray comparison for objects of different scales before and after introducing P2 %

模型 AP_small AP_medium AP_large AP(all)
Baseline 85.1 89.8 86.4 83.4
四尺度 85.8 89.9 86.8 83.8

注:面积阈值基于原始分辨率(1 920×1 080)下的标注边界框面积计算,非640×640输入尺度下的面积。面积分位数按训练集目标的33%和67%分位点划分。AP_small为小尺度目标平均精度(面积<692 791像素²);AP_medium为中尺度目标平均精度(692 791像素²≤面积<1 039 070像素²);AP_large为大尺度目标平均精度(面积≥1 039 070像素²)。

2.1.2 Adaptive SimAM注意力模块

荷斯坦奶牛体表黑白斑块易与畜舍背景形成局部相似外观15,围栏、草料及个体间遮挡使末端关键点可见信息缺失。引入P2浅层高分辨率分支后,细粒度空间信息得以保留,但背景纹理与遮挡边缘等高频干扰也随之增强。现有注意力方法主要通过通道重标定、空间重标定或二者串联的方式增强特征响应25,典型代表如挤压与激励(Squeeze-and-Excitation,SE)模块26、高效通道注意力(Efficient Channel Attention,ECA)模块27及卷积块注意力模块(Convolutional Block Attention Module,CBAM)28等,但在奶牛遮挡场景中,静态权重难以区分遮挡边界的高频噪声与关键点判别纹理。SimAM29通过能量函数生成无参数三维注意力权重,可兼顾通道与空间信息;空间交叉注意力模块(Spatial Intersection Attention Module, SIAM)30进一步引入跨维度统计以增强判别表达;Zhao等17将SimAM用于YOLOv8n-Pose奶牛姿态估计,验证了其应用潜力。上述方法虽具轻量化优势,但多依赖固定正则系数或预设统计关系,对特征分布及层级差异的自适应调节仍有限。
针对此问题,本研究在SimAM的基础上提出注意力模块Adaptive SimAM(图6)。与现有工作将SimAM直接嵌入网络不同,本研究面向奶牛体表纹理与畜舍背景相似、多源遮挡频发以及引入P2高分辨率特征后浅层噪声易被放大等特点,从自适应正则化学习、多尺度能量建模和层级差异化部署三个方面分别解决参数固定、感受野单一和层级无差异的局限性。
图5 Adaptive SimAM 模块整体架构示意图

Fig.5 Schematic diagram of the overall Adaptive SimAM module architecture

图6 荷斯坦奶牛姿态估计中Adaptive SimAM关键超参数敏感性分析

Fig.6 Sensitivity analysis of key hyperparameters of Adaptive SimAM for Holstein dairy cow pose estimation

1)自适应参数学习机制。原始SimAM采用固定正则化系数 λ 29,对不同样本与网络层级施加统一约束。在遮挡频发、背景干扰复杂的奶牛场景中,固定正则系数难以根据当前特征分布区分高频噪声与残存纹理。为此,参考自适应正则化思想31,样本自适应的正则系数生成分支,基于 G A P提取的全局统计描述子估计当前样本在该层的整体响应状态,并动态生成样本级正则系数 λ a d p,如公式(4)所示
λ a d p = ε λ + 1 - ε λ σ W 2   δ W 1   G A P ( x ) + b 1 + b 2   
式中: x R C × H × W为当前层输入特征图; G A P ( )为全局平均池化,沿空间维度压缩后得到维度为 C的通道描述子; W 1 R ( C / r ) × C W 2 R 1 × ( C / r )为全连接层权重,通道缩减比 r控制分支参数规模; δ ( ) σ ( )分别为ReLU与Sigmoid激活函数; ε λ = 1 × 10 - 4为下界常数,保证 λ a d p具有非零下界以提升数值稳定性。 λ a d p为样本级标量,依据当前样本整体特征分布动态调节能量函数的正则化强度。
2)多尺度边缘感知显著性调制。原始SimAM基于单尺度响应关系进行显著性估计,难以兼顾局部残存纹理与较大感受野上下文,在遮挡场景中对蹄部边缘与围栏、草料等背景高频噪声的区分能力有限。为此,引入多感受野上下文聚合32与基于Sobel梯度的边缘结构先验,构建边缘感知调制项 M e,如公式(5)所示:
M e X n = k { 1,3 , 5,7 } w k p k X n 1 + α G ^ n   
式中: p k 为核大小为 k的平均池化, k = 1时退化为恒等映射; w k为对应尺度权重; α为边缘增强系数; G ^ n为归一化梯度响应,将多核池化得到的多尺度上下文特征与梯度加权项逐元素相乘,实现对微小目标区域的边缘增强调制。
尺度权重 w k 由可学习参数 β k经 Softmax 归一化得到,如式(6)所示。
w k = e x p ( β k ) / j { 1,3 , 5,7 } e x p ( β j )
式中: β k为对应尺度 k的可学习参数,初始各分支权重均为0.25,该归一化使各尺度权重非负且和为 1,令模型在训练过程中自适应分配不同感受野的贡献程度。
归一化梯度响应 G ^ n计算见式(7)
G ˜ n , c , h , w = G n , c , h , w m a x h ' , w '   G n , c , h ' , w ' + ε g       
式中: G n , c , h , w为基于Sobel算子的梯度幅值; ε g为数值稳定常数;该归一化按逐样本、逐通道独立计算,不依赖批次统计量,训练与推理阶段计算口径保持一致。
其中,Sobel梯度幅值由水平与垂直方向梯度分量合成,如式(8)所示。
G n , c , h , w = G x , n , c , h , w 2 + G y , n , c , h , w 2
式中: G x , n , c , h , w G y , n , c , h , w分别为水平,垂直方向的Sobel梯度分量;二者平方和开方即得该位置的边缘强度,据此在式(7)中标定图像局部纹理变化剧烈的区域
进而,将边缘感知调制项 M e ( X n )与经自适应正则化后的SimAM三维注意力响应相融合,得到最终注意力权重,如式(9)所示。
A n * = A λ ( X n ) σ ( M e ( X n )      
式中: A λ X n 为自适应正则化后的SimAM三维注意力响应; σ 为Sigmoid函数。综上,该权重在保留通道-空间联合建模能力的同时,融合了边缘结构与多尺度上下文信息,有效提升了遮挡条件下微小关键点的响应稳定性。
公式(5)与公式(6)并非原始SimAM能量最小化闭式解的直接推导,而是面向遮挡场景构建的样本级自适应调节项与多尺度边缘感知调制项;公式(6)所定义的边缘感知调制项融合局部残存纹理与较大感受野上下文信息,以提升遮挡条件下关键点定位的稳定性。
3)差异化特征增强策略。考虑不同层级特征在分辨率、语义强度与噪声分布上的差异,本文在主干P2、P3、P4对应的C3k2模块后及Neck的P3尺度分别部署Adaptive SimAM:P2层分辨率高但背景噪声较多,用于保留蹄部、耳尖等微小关键点的边缘判别特征;P3与P4层在遮挡场景下易产生局部响应失衡,用于增强中深层特征对遮挡区域与关键结构的区分能力;Neck P3用于抑制融合后特征中的背景冗余响应,稳定关键点定位。检测头阶段不再额外部署,以控制预测端计算开销。
4)Adaptive SimAM关键超参数敏感性分析。为验证关键超参数设置的合理性,对边缘增强系数 α、池化核组合 k和通道缩减比 r分别进行单因素对比实验。各组实验分别将随机种子设为2024、2025和2026,独立重复训练3次,并以Pose mAP@0.5:0.95的均值与标准差为评价指标,结果见图6。如图6a所示, α=0.10时性能最优,达到(84.6±2.0)%; α过小时边缘增强不足, α过大时引入额外背景响应,均不利于关键点定位。图6b可知,配置{1,3,5,7}时性能最优,达到(84.6±0.7)%;配置{1,3}时性能最低且波动最大,达到(80.1±6.1)%,说明适当扩展池化范围能够提升局部边界表征能力并改善训练稳定性。图6c得出, r=8时性能最优,达到(84.6±1.2); r=4时性能最低且波动最大, r=2与 r=16分别因通道压缩不足和特征表达受限而低于 r=8。综合上述结果,本研究将Adaptive SimAM超参数设置为 α=0.10、池化核组合{1,3,5,7}、通道缩减比 r=8,该配置在检测精度与训练稳定性之间取得较好平衡。
遮挡鲁棒性验证与分析。受控遮挡扰动下的注意力机制对比。为在可控条件下比较Adaptive SimAM与代表性注意力机制的特征判别能力,选取SE、CBAM、ECA、SimAM及SIAM进行对比,在验证集上构建受控遮挡扰动测试环境:每张图像随机添加6~8个遮挡块(大小180~250像素,占图像宽度28%~39%),约束遮挡至少2个蹄部关键点和1或2个腿部关节。将16个关键点按面积划分为3类(表4),采用COCO标准24评估不同目标关键点相似度(Object Keypoint Similarity,OKS)阈值下的平均精度AP。
表4 遮挡测试环境下不同注意力机制对各尺度关键点检测性能对比

Table 4 Performance comparison of different attention mechanisms for keypoints detection at different scales under the occlusion %

模型 Tiny蹄部) Small关节) Medium头颈躯干) 平均精度均值
Baseline(YOLOv11n-Pose) 75.8 79.0 76.5 77.1
SE 75.8 79.0 76.6 77.1
CBAM 76.0 79.1 76.7 77.3
ECA 76.0 79.2 76.7 77.3
SIAM 76.1 79.3 77.2 77.5
SimAM(固定正则、非自适应) 76.2 79.3 77.4 77.6
Adaptive SimAM(自适应正则λ) 76.4 79.5 77.5 77.8
表4可知,SE、CBAM、ECA等通道或空间重标定方法对受控遮挡扰动条件下Tiny类(蹄部)关键点的改善均有限,平均AP最高仅达77.3%;SIAM与固定参数SimAM平均AP分别为77.5%和77.6%,三维注意力相对通道/空间方法有一定改善,但二者均未引入针对输入特征分布的显式自适应调节。采用Adaptive SimAM后,Tiny类AP提升至76.4%、平均AP提升至77.8%,3类关键点均取得正向增益。进一步在3个随机种子下重复训练,Adaptive SimAM与固定参数SimAM的受控遮挡扰动测试平均AP(独立于表4单次结果)分别为(77.8±0.3)%与(77.6±0.4)%,且全部3个种子下前者均高于后者,表明自适应正则化机制对受控遮挡扰动条件下关键点判别能力的改善具有跨随机初始化的稳定性。

2.2 试验环境与参数设置

为保证所有模型试验结果的公正性,采用Tesla V100-SXM2-32 GB GPU,Linux操作系统。以PyTorch 2.0.1为深度学习框架,以CUDA 11.8为并行计算平台,以Python 3.8.20为编写语言。模型加载COCO Keypoints预训练权重进行初始化,并分别以 2024、2025 和 2026 作为随机种子重复训练 3 次。模型训练输入图像分辨率像素为640×640,使用随机梯度下降(Stochastic Gradient Descent,SGD)优化器,训练批次大小为16,迭代次数为300轮,初始学习率为0.01。此外,训练期引入Mosaic与Albumentations(含亮度/色彩扰动、轻微模糊等)组合增强策略,以提升模型对复杂光照与多尺度姿态变化的适应能力,验证置信度阈值设为0.15。

3 结果与分析

3.1 模型评价指标

本实验采用精确率(Precision)、召回率(Recall)、mAP@0.5及mAP@0.5:0.95对模型性能进行评价,以参数量Params和计算量GFLOPs作为复杂度指标,以端到端每秒帧数(Frames Per Second,FPS)衡量推理效率,从精度、实时性与计算资源消耗等方面对模型进行综合分析。FPS测试在相同硬件环境下进行,输入像素尺寸为640×640,batch size为1,采用PyTorch FP16推理,测试前进行50次预热,并对200张验证集图像重复测试3次取平均值,统计包含预处理、模型推理与后处理的完整端到端耗时。

3.2 消融实验

为全面验证各改进模块对奶牛姿态估计性能的影响,并避免数据合并掩盖不同数据源的分布差异,在自建奶牛姿态数据集与CMBN数据集上分别独立训练并独立评估,设计了4组模型配置,YOLOv11n-Pose作为Baseline。在此基础上依次仅引入Adaptive SimAM模块(+Adaptive SimAM)、仅调整检测头结构并引入非对称四尺度检测头(+4Scale),以及同时集成两者(YOLOv11n-AS4D)。各配置的实验结果如表5表6所示。
表5 自建荷斯坦奶牛姿态估计数据集上YOLOv11n-AS4D消融实验结果

Table 5 Ablation experiment results of YOLOv11n-AS4D on the self-constructed Holstein dairy cow pose estimation dataset

方法 精确率/% 召回率/% mAP@0.5/% mAP@0.5:0.95/% Params/M 计算量/GFLOPs FPS/(帧/s)
YOLOv11n-Pose 97.2±0.2 97.2±0.2 97.7±0.1 83.4±0.2 2.90 7.3 93.2
+Adaptive SimAM 97.4±0.1 97.6±0.1 97.6±0.1 84.0±0.2 2.92 7.3 91.5
+4Scale 97.2±0.1 97.4±0.1 98.1±0.1 83.8±0.2 2.25 9.7 84.3
YOLOv11n-AS4D 97.6±0.2 97.6±0.1 98.2±0.1 84.6±0.3 2.27 9.8 83.1

注:mAP@0.5为OKS阈值0.50下的关键点平均精度,mAP@0.5:0.95为OKS阈值0.50~0.95下的关键点平均精度,表中精度指标为3个随机种子重复训练所得均值±标准差,Params和GFLOPs为模型结构统计值。下表同。

表6 CMBN牛只姿态估计数据集上YOLOv11n-AS4D消融实验结果

Table 6 Ablation experiment results of YOLOv11n-AS4D on the CMBN cattle pose estimation dataset

方法 精确率/% 召回率/% mAP@0.5/% mAP@0.5:0.95/% Params/M 计算量/GFLOPs FPS(帧/s)
YOLOv11n-Pose 97.7±0.1 98.2±0.2 98.3±0.1 82.4±0.3 2.91 7.2 93.2
+Adaptive SimAM 97.8±0.2 98.6±0.2 98.9±0.2 83.2±0.2 2.92 7.3 91.5
+4Scale 97.8±0.1 98.5±0.2 98.4±0.1 83.1±0.4 2.26 9.7 84.3
YOLOv11n-AS4D 98.0±0.1 98.7±0.1 98.9±0.2 83.8±0.3 2.28 9.8 83.1

3.2.1 非对称四尺度检测头的影响分析(+4Scale)

单独引入非对称四尺度检测头(+4Scale)后,模型性能呈小幅提升,增益主要体现在召回率与mAP@0.5:0.95等定位质量相关指标上。在自建数据集上(表5),mAP@0.5由97.7%提升至98.1%(提升0.4个百分点),mAP@0.5:0.95由83.4%提升至83.8%(提升0.4个百分点),召回率由97.2%提升至97.4%。在CMBN数据集上(表6),mAP@0.5提升0.1个百分点,召回率提升0.3个百分点,mAP@0.5:0.95提升0.7个百分点,表明引入P2高分辨率特征有助于增强模型对蹄部、耳尖等微小关键点的空间建模能力,但单独引入时整体增益幅度仍较有限。此外,+4Scale的参数量(2.25 M)较Baseline(2.90 M)有所精简,计算量由7.3增至9.7 GFLOPs,计算增量主要来自新增P2预测分支;参数量下降的原因将在3.2.4节结合四尺度子策略消融结果进一步分析。对四尺度检测头中Add与Concat两种P2特征融合方式进行了对比,结果见表7。Concat在两个数据集上的mAP@0.5:0.95较Add均提升0.2个百分点,参数量仅增加0.03 M,计算量仅增加0.2 GFLOPs,表明Concat相较逐元素相加更有利于保留P2浅层细节与深层语义信息、减少特征抵消。因此,采用Concat作为P2特征融合方式。
表7 不同特征融合方式对四尺度检测头性能的影响

Table 7 Effects of different feature fusion strategies on the four-scale detection head

融合方式 自建 mAP@0.5:0.95/% CMBN mAP@0.5:0.95/% Params/M 计算量/GFLOPs
Add 83.6 82.9 2.22 9.5
Concat 83.8 83.1 2.25 9.7

3.2.2 +Adaptive SimAM注意力模块的影响分析

单独引入Adaptive SimAM(+Adaptive SimAM)后,多数精度指标呈提升趋势。在自建数据集上(表5),精确率由97.2%提升至97.4%,召回率由97.2%提升至97.6%,mAP@0.5:0.95由83.4%提升至84.0%;mAP@0.5出现轻微波动(97.7%→97.6%)。在CMBN数据集上(表6),精确率提升0.1个百分点,召回率提升0.4个百分点,mAP@0.5提升0.6个百分点,mAP@0.5:0.95提升0.8个百分点。总之,Adaptive SimAM的增益主要体现在遮挡与背景干扰条件下的特征判别稳定性,而非直接提升空间分辨率。引入后计算量维持在7.3GFLOPs,参数量小幅增至2.92 M,计算代价可控。
为进一步分析Adaptive SimAM对特征响应分布的影响,在相同输入图像下对原始SimAM与Adaptive SimAM的能量响应进行可视化对比,结果如图7所示。
图7 荷斯坦奶牛姿态估计中原始SimAM与Adaptive SimAM能量响应可视化对比

注:a.原始图 b. 原始SimAM c. Adaptive SimAM能量响应图 能量响应图

Fig.7 Visualization comparison of energy responses between original SimAM and Adaptive SimAM n Holstein dairy cow pose estimation

图7可知,原始SimAM的响应较多分布于奶牛斑块边界、牛体轮廓及部分背景纹理区域,响应相对分散;相比之下,Adaptive SimAM在牛体主体、腿部轮廓及蹄部附近形成了更连续的响应分布,且部分背景区域的无关响应有所减弱。尤其在前后蹄及下肢边缘区域,响应连续性较原始SimAM更明显,说明自适应正则化与多尺度能量建模有助于增强末端关键点邻域的特征表达。

3.2.3 非对称四尺度检测头结构与Adaptive SimAM的协同效果(YOLOv11n-AS4D)

在自建数据集上(表5),YOLOv11n-AS4D的精确率和召回率均达到97.6%,较YOLOv11n-Pose分别提升0.4和0.4个百分点;mAP@0.5达到98.2%,提升0.5个百分点;mAP@0.5:0.95达到84.6%,提升1.2个百分点。在CMBN数据集上(表6),模型精确率和召回率分别达到98.0%和98.7%,较YOLOv11n-Pose分别提升0.3和0.5个百分点;mAP@0.5达到98.9%,提升0.6个百分点;mAP@0.5:0.95达到83.8%,提升1.4个百分点。模型参数量由2.90/2.91 M降至2.27/2.28 M,计算量由7.3/7.2 GFLOPs增至9.8 GFLOPs;与+4Scale基本一致,表明Adaptive SimAM的引入未进一步增加计算开销。
在推理效率方面,引入Adaptive SimAM后FPS由93.2帧/s降至91.5帧/s(降幅约1.8%);引入非对称四尺度检测头后,FPS降至84.3帧/s(降幅约9.5%),YOLOv11n-AS4D为83.1帧/s,与+4Scale基本持平,在精度提升的同时仍保持在83帧/秒以上,满足实时姿态估计需求。
综上,二者协同后在两个数据集上的mAP@0.5:0.95均提升超过1个百分点,且FPS仍保持在83帧/秒以上,表明模型在精度、参数量与推理效率之间取得了较好权衡。

3.2.4 四尺度子策略消融

表7验证Concat融合方式有效性的基础上,为进一步验证P2回传阻断、DWConv替换与Concat融合三项设计的独立贡献,本节以未引入上述优化的朴素四尺度版本(+4Scale-naive,GFLOPs为12.2)为基准开展消融实验,结果见表8。以+4Scale-naive为基准,单独阻断P2回传(+4Scale-NF)后,计算量由12.2降至9.7 GFLOPs,参数量由3.10 M降至2.26 M,mAP@0.5:0.95基本保持不变,表明P2在自底向上路径中的重复聚合主要引入计算冗余,对精度贡献有限。单独引入DWConv(+4Scale-DW)后,计算量降低0.8 GFLOPs,参数量减少0.24 M,mAP@0.5:0.95由83.6%小幅提升至83.7%,说明DWConv能够在保持精度的同时有效降低模型复杂度。+4Scale-NF-DW同时引入两项优化后,相较+4Scale-naive计算量减少20.5%、参数量减少27.4%,mAP@0.5:0.95由83.6%提升至83.8%,精度基本持平并略有改善。由于两项优化均作用于自底向上路径,计算收益存在部分重叠,总体降幅未呈现线性叠加。
表8 自建荷斯坦奶牛姿态数据集上四尺度子策略消融实验结果

Table 8 Ablation experiment results of four-scale sub-strategies on the self-constructed Holstein dairy cow pose dataset

模型 P2回传 下采样卷积 Params/M 计算量/GFLOPs mAP@0.5/% mAP@0.5:0.95/%
YOLOv11n 2.90 7.3 97.7 83.4
+4Scale-naive 保留 Conv 3.10 12.2 98.1 83.6
+4Scale-NF 阻断 Conv 2.26 9.7 98.0 83.6
+4Scale-DW 保留 DWConv 2.86 11.4 98.1 83.7
+4Scale-NF-DW 阻断 DWConv 2.25 9.7 98.1 83.8

注:P2回传列“阻断”表示切断自底向上路径中P2→P3的下采样回传;下采样卷积类型用于P3→P4和P4→P5路径;YOLOv11n为基线模型,用于提供整体性能参照;+4Scale-NF-DW为同时引入P2回传阻断与DWConv替换的四尺度优化结构,对应表5、表7中的+4Scale;加粗为本研究最终方案。

3.2.5 复杂场景鲁棒性分析

为评估模型在真实遮挡场景下的鲁棒性,依据CMBN测试集中关键点可见性标注构建遮挡测试子集。对每个牛只实例,定义遮挡比例为不可见与部分可见关键点数量之和占16个关键点总数的比例;多头牛图像取遮挡比例最大的实例作为该图像的遮挡程度。据此将测试集划分为无遮挡子集test_none(遮挡比例为0)、轻度遮挡子集test_light(遮挡比例大于0且小于0.2)和重度遮挡子集test_severe(遮挡比例不小于0.2,对应至少4个关键点不可见或部分可见),3个子集互不重叠,样本量分别为154、151和89张,各模型评估结果见表9,随着遮挡程度加重,各模型AP与平均召回率(Average Recall,AR)均呈下降趋势。YOLOv11n-Pose的AP由无遮挡子集的86.6%降至重度遮挡子集的73.5%,降幅为13.1个百分点;YOLOv11n-AS4D由87.8%降至75.9%,降幅为11.9个百分点,表明改进模型在遮挡加剧时精度衰减相对平缓。在重度遮挡子集上,单独引入非对称四尺度检测头后AP_severe提升至74.5%,单独引入Adaptive SimAM后提升至74.7%;二者联合后进一步提升至75.9%,表明P2高分辨率特征补偿与自适应注意力增强在围栏、草料架遮挡及个体互遮挡等真实场景下具有互补作用。
表9 CMBN牛只姿态数据集中不同遮挡程度下各模型性能对比

Table 9 Performance comparison under occlusion levels %

模型 AP_none AP_occ AP_sev AR_none AR_occ AR_sev
YOLOv11n-Pose 86.6 77.5 73.5 90.0 81.4 77.4
+4Scale 87.2 78.1 74.5 90.3 81.9 78.6
+Adaptive SimAM 87.3 78.2 74.7 90.5 82.5 78.9
YOLOv11n-AS4D 87.8 79.0 75.9 91.1 82.9 80.3
为进一步验证模型在视频序列中的关键点稳定性,选取50段3 s连续视频片段进行测试,引入帧间关键点抖动(Raw Jitter)、指数移动平均(Exponential Moving Average,EMA)平滑后抖动(EMA Jitter)和关键点缺失率3项指标,结果见表10,可知YOLOv11n-AS4D在3项指标上均优于基线模型,较基线分别降低39.0%、47.3%和77.8%。模块对比表明,非对称四尺度检测头主要改善关键点缺失问题(缺失率由8.73%降至2.46%),Adaptive SimAM主要抑制帧间抖动(Raw Jitter由0.034降至0.021);二者结合后在连续性与完整性两方面均取得最优。
表10 连续视频序列中荷斯坦奶牛关键点稳定性对比

Table 10 Keypoint stability comparison of Holstein dairy cows on continuous video sequence

模型 帧间关键点抖动 EMA平滑后抖动 关键点缺失率/%
YOLOv11n-Pose 0.034 0.022 8.73
+4Scale 0.027 0.018 2.46
+Adaptive SimAM 0.021 0.012 4.46
YOLOv11n-AS4D 0.021 0.012 1.94
此外,在Tesla V100上以TensorRT-FP16部署后,YOLOv11n-AS4D 推理速度由83.1 帧/s提升至约250 帧/s(速度口径与表5一致:batch=1、640×640,统计preprocess+inference+postprocess之和),Pose mAP@0.5:0.95由84.6%降至82.2%,下降2.4个百分点,关键点缺失率1.94%,精度损失较小,表明模型具备向边缘计算平台部署的基础条件。

3.2.6 可视化与逐关键点误差分析

为从定性与定量两个层面验证改进模型的检测效果,图8为YOLOv8n、YOLOv11n与YOLOv11n-AS4D在典型遮挡样本上的关键点检测结果对比。在蹄部关键点定位方面,YOLOv8n存在较明显的落点偏移,部分蹄尖关键点偏离实际位置;YOLOv11n有所改善,但仍存在轻微偏差;YOLOv11n-AS4D的蹄部关键点落点更贴近真实蹄尖位置,定位更准确。在耳尖关键点方面,YOLOv8n与YOLOv11n均存在一定程度的位置偏移,YOLOv11n-AS4D的耳尖定位更为准确。上述结果从定性角度表明,P2高分辨率特征层的引入有效改善了末端微小关键点在复杂背景下的空间定位能力。
图8 YOLOv8n、YOLOv11n、YOLOv11n-AS4D关键点检测对比

注:a.YOLOv8n b.YOLOv11n c.YOLOv11-AS4D

Fig. 8 Keypoint detection comparison among YOLOv8n,YOLOv11n and YOLOv11n-AS4D

图9给出YOLOv11n-Pose与YOLOv11n-AS4D在验证集上的逐关键点定位误差对比。误差采用预测坐标与标注坐标之间的欧氏距离计算,误差棒表示标准差。由图10可知,YOLOv11n-AS4D在全部16个关键点上的定位误差均低于基线模型,误差减少量为1.6~13.0 px。其中头顶部关键点(kp1)改善幅度最大,误差降低13.0 px;4个蹄部关键点误差分别降低3.7、5.1、5.6和1.6 px,结合3.2.1节结果可知,P2高分辨率浅层特征对蹄部等末端关键点的定位改善具有重要作用。16个关键点中有13个的预测标准差低于基线模型,表明改进模型在降低平均定位误差的同时,预测离散程度亦有所降低,与表5表6中整体性能提升趋势一致。
图9 YOLOv11n-Pose与YOLOv11n-AS4D在荷斯坦奶牛数据集上关键点定位误差对比

Fig.9 Per-keypoint localization error comparison between YOLOv11n-Pose and YOLOv11n-AS4D for Holstein dairy cow pose estimation

图10 YOLOv11n-AS4D在三种典型场景下的奶牛姿态估计可视化结果

注:a. 采食(设施遮挡) b. 行走(个体遮挡) c.站立(无遮挡)

Fig.10 Visualization results of Holstein cattle pose estimation by YOLOv11n-AS4D in three typical scenarios

3.3 不同模型的对比试验

选取奶牛姿态估计中几种性能优异的模型进行对比实验,包括YOLOv5、YOLOv6、YOLOv8n-Pose、YOLOv10n、YOLOv11n、YOLOv1233、YOLOv1334、经典的姿态估计算法HRNet-W325和RTMPose-S7,以及近两年针对奶牛场景的改进方法WU等10与ZHAO等17实验结果,见表11表12
表11 自建荷斯坦奶牛姿态数据集上不同算法对比实验结果

Table 11 Comparative experiment results of different algorithms on the self-constructed dataset

方法 精确率/% 召回率/% mAP@0.5/% mAP@0.5:0.95/% Params/M 计算量/GFLOPs
HRNet-W325] 96.3±0.2 96.0±0.2 96.9±0.1 81.7±0.3 28.54 15.7
RTMPose-S7 96.1±0.2 91.0±0.3 95.5±0.2 83.1±0.3 5.47 5.4
WU11 96.7±0.1 97.0±0.2 96.6±0.1 84.0±0.3 6.90 6.8
ZHAO18 97.4±0.2 97.4±0.2 98.0±0.1 83.9±0.2 3.11 8.1
YOLOv5 96.6±0.2 96.8±0.2 97.0±0.1 81.9±0.2 2.78 6.7
YOLOv6 97.1±0.2 96.3±0.2 97.5±0.1 82.8±0.3 4.40 12.3
YOLOv8n-Pose 97.2±0.1 97.0±0.2 97.7±0.1 83.2±0.2 3.00 8.2
YOLOv10n 95.4±0.2 96.4±0.2 97.6±0.1 83.0±0.3 2.73 7.1
YOLOv1233 97.0±0.2 95.8±0.2 97.4±0.2 80.5±0.4 2.83 7.5
YOLOv1334 97.2±0.2 97.4±0.2 96.2±0.2 81.3±0.3 2.72 7.3
YOLOv11n-Pose 97.2±0.2 97.2±0.2 97.7±0.1 83.4±0.2 2.90 7.3
YOLOv11n-AS4D 97.6±0.2 97.6±0.1 98.2±0.1 84.6±0.3 2.27 9.8
表12 CMBN奶牛姿态数据集上不同算法对比实验结果

Table 12 Comparative experiment results of different algorithms on the CMBN cattle pose dataset

方法 精确率/% 召回率/% mAP@0.5/% mAP@0.5:0.95/% Params/M 计算量/GFLOPs
HRNet-W325 97.1±0.2 97.0±0.2 97.3±0.1 82.5±0.3 28.12 15.7
RTMPose-S7 96.4±0.2 88.8±0.3 95.8±0.2 82.0±0.3 5.45 5.4
WU11 97.0±0.2 97.1±0.2 96.6±0.1 82.9±0.3 6.90 6.8
Zhao18 97.8±0.22 97.9±0.2 98.0±0.2 82.7±0.2 3.11 8.1
YOLOv5 97.4±0.2 97.9±0.2 97.4±0.2 80.9±0.3 2.78 6.7
YOLOv6 97.9±0.1 97.3±0.2 98.0±0.2 81.9±0.3 4.32 12.3
YOLOv8n-Pose 97.9±0.2 98.0±0.2 98.1±0.1 82.2±0.2 3.00 8.2
YOLOv10n 96.2±0.2 97.4±0.2 98.1±0.2 82.1±0.3 2.73 7.1
YOLOv1233 97.8±0.3 96.8±0.2 97.9±0.1 79.9±0.4 2.83 7.5
YOLOv1334 98.0±0.2 98.5±0.2 96.5±0.2 81.7±0.3 2.70 7.3
YOLOv11n-Pose 97.7±0.1 98.2±0.2 98.3±0.1 82.4±0.3 2.91 7.2
YOLOv11n-AS4D 98.0±0.1 98.7±0.1 98.9±0.2 83.8±0.3 2.28 9.8

3.3.1 整体精度对比

以YOLOv11n为基线,重点考察改进模型在mAP@0.5:0.95上的性能表现。该指标基于更严格的OKS阈值范围评估关键点定位精度,能够更全面地反映模型对蹄部、耳尖等微小关键点的精细定位能力。在自建数据集上,YOLOv11n-AS4D的mAP@0.5:0.95达到84.6%,较基线YOLOv11n提升1.2个百分点;在CMBN数据集上达到83.8%,较基线提升1.4个百分点。
与YOLO系列其他模型相比,改进模型在两个数据集上均处于最优水平,较YOLOv8n-Pose分别高出1.4和1.6个百分点;在自建数据集上较YOLOv12和YOLOv13分别高出4.1和3.3个百分点,在CMBN数据集上分别高出3.9和2.1个百分点。值得注意的是,YOLOv13虽具有较高的精确率和召回率,但其mAP@0.5:0.95在两个数据集上分别为81.3%和81.7%,低于YOLOv11n的83.4%和82.4%,说明其在严格OKS阈值下的关键点定位稳定性不足,YOLOv11n更适合作为后续改进的基础模型。与经典姿态估计方法相比,YOLOv11n-AS4D较RTMPose-S在两个数据集上分别高出1.5和1.8个百分点,较HRNet-W32分别高出2.9和1.3个百分点。

3.3.2 模型复杂度与效率权衡

在参数量方面,YOLOv11n-AS4D在自建数据集和CMBN数据集上的参数量分别为2.27 M和2.28 M,较YOLOv11n-Pose分别减少21.7%和21.6%,且仅为RTMPose-S的约41.5%,亦低于WU等(6.9 M)和ZHAO等(3.11 M),表明本方法并非依赖模型规模扩张实现性能提升,而是通过结构重组提高了参数利用效率。
在计算量方面,模型在自建数据集和CMBN数据集上的计算量分别由7.3和7.2 GFLOPs增至9.8 GFLOPs,增幅约为34%和36%,高于WU等(6.8 GFLOPs)和ZHAO等(8.1 GFLOPs)。该增量主要来源于P2高分辨率分支的额外特征计算,用于强化蹄部、耳尖等末端关键点的空间细节编码。从精度收益看,该计算投入在自建与CMBN数据集上分别带来1.2和1.4个百分点的mAP@0.5:0.95提升,说明额外算力能够有效转化为严格定位指标上的性能增益。综合来看,YOLOv11n-AS4D在参数量显著低于HRNet-W32、RTMPose-S、WU等和ZHAO等方法的前提下,实现了最优的mAP@0.5:0.95,体现出较好的精度-复杂度平衡。

3.3.3 与现有研究的对比分析

WU等11采用改进YOLOv8n检测器与改进RTMPose组成的两阶段框架,侧重复杂多目标遮挡场景下的关键点定位;ZHAO等18以YOLOv8n-Pose为基础引入固定参数SimAM与EfficientRepBiPAN,侧重轻量化结构优化与注意力增强。上述方法在原文中采用的数据集与训练策略不尽相同,因此本研究在统一实验设置下进行复现与横向对比,结果见表11表12。WU等为两阶段框架,复现时保持原有推理流程,关键点输出头调整为16个以适配本文标注;表中参数量6.9 M为其姿态估计分支统计值,未含前置检测器开销。
实验结果表明,本方法在自建数据集和CMBN数据集上的mAP@0.5:0.95分别达到84.6%和83.8%,较WU等分别高出0.6和0.9个百分点,较ZHAO等分别高出0.7和1.1个百分点。WU等两阶段流水线框架的参数量(6.9 M)为本方法的3.04倍;ZHAO等虽引入EfficientRepBiPAN进行结构压缩,但其SimAM正则系数固定,对不同层级特征分布的自适应调节能力有限,参数量(3.11 M)仍高于本方法37.0%。在参数量低于WU等和ZHAO等方法的条件下,本方法在两个数据集上的mAP@0.5:0.95均保持领先,说明其性能优势并非依赖参数规模扩张,而主要得益于尺度补偿、轻量化特征融合及自适应注意力增强的协同设计。此外,本方法推理帧率达83帧/s,具备面向牧场边缘设备实时部署的应用潜力。
为进一步直观展示本方法在真实牧场环境中的检测效果,图10给出3种典型场景下的关键点检测结果。
图10所示,在采食姿态伴随设施遮挡的场景下,模型仍能准确定位蹄部与头部关键点;在个体间相互遮挡的行走场景下,被遮挡牛只的关键点定位保持稳定;在无遮挡站立场景下,16个关键点均得到完整且精确的检测。上述结果表明,本方法在不同遮挡程度和姿态条件下均具备可靠的关键点定位能力,具备实际牧场部署的应用价值。

4 结 论

针对奶牛姿态估计中的遮挡干扰与微小关键点特征丢失问题,基于YOLOv11构建了融合自适应注意力与四尺度检测的改进模型,并在自建数据集及CMBN数据集上进行了验证,得出以下结论:
1)设计了基于P2高分辨率特征的非对称四尺度检测头与Adaptive SimAM模块,二者分工明确:前者通过渐进式通道配置与单向特征流缓解微小关键点的空间信息丢失,后者通过自适应正则化与层级差异化部署提升遮挡条件下的判别稳定性,联合后在两个数据集上均获得稳定性能提升。
2)改进模型在自建数据集和CMBN数据集上的精确率分别达97.6%和98.0%,召回率分别达97.6%和98.7%,mAP@0.5:0.95分别达84.6%和83.8%。在参数量仅为RTMPose-S约41.5%的条件下,mAP@0.5:0.95仍分别提升1.2和1.4个百分点,表明模型在保持精度的同时实现了有效的参数压缩与结构优化;TensorRT-FP16部署后,模型推理速度提升至约250帧/s,具备进一步向边缘计算平台迁移的基础。
3)研究发现,模型在视频序列中的关键点稳定性较基线有所改善,帧间抖动与关键点缺失率均有下降;但在极端遮挡场景下对非刚性关键点的定位精度仍存在波动,表明单帧视觉建模在复杂遮挡环境下仍存在结构性限制。
未来需引入时序建模或形变约束,在不同品种数据集上进行跨域验证以提升鲁棒性,并开展嵌入式设备上的真实部署测试以验证边缘端实时推理能力。相关代码及部分数据资源将在论文录用后公开发布。

本研究不存在研究者以及与公开研究成果有关的利益冲突。

[1]
FOOD AND AGRICULTURE ORGANIZATION OF THE UNITED NATIONS. FAOSTAT: Production: Crops and livestock products: cattle stocks[DB/OL]. Rome: FAO, 2025[2026-07-07].

[2]
ANTOGNOLI V, PRESUTTI L, BOVO M, et al. Computer vision in dairy farm management: A literature review of current applications and future perspectives[J]. Animals, 2025, 15(17): 2508.

[3]
陈若彤, 刘继芳, 张志勇, 等. 规模化牛场智能巡检路径规划算法[J]. 智慧农业(中英文), 2026, 8(1): 178-191.

CHEN R T, LIU J F, ZHANG Z Y, et al. Intelligent inspection path planning algorithm for large-scale cattle farms[J]. Smart Agriculture, 2026, 8(1): 178-191.

[4]
CAO Z, SIMON T, WEI S E, et al. Realtime multi-person 2D pose estimation using part affinity fields[C]// 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). Piscataway, New Jersey, USA: IEEE, 2017: 1302-1310.

[5]
WANG J D, SUN K, CHENG T H, et al. Deep high-resolution representation learning for visual recognition[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2021, 43(10): 3349-3364.

[6]
MATHIS A, MAMIDANNA P, CURY K M, et al. DeepLabCut: markerless pose estimation of user-defined body parts with deep learning[J]. Nature Neuroscience, 2018, 21(9): 1281-1289.

[7]
JIANG T, LU P, ZHANG L, et al. RTMPose: Real-time multi-person pose estimation based on MMPose[PP/OL] arXiv:2303.07399, 2023.

[8]
LI X W, SUN K, FAN H B, et al. Real-time cattle pose estimation based on improved RTMPose[J]. Agriculture, 2023, 13(10): 1938.

[9]
LIU K, LI S Y, LV Y X, et al. Structure-aware multi-animal pose estimation for space model organism behavior analysis[J]. Animals, 2025, 15(21): 3139.

[10]
LI F J, WANG Z H, DING X X, et al. FSMC-pose: frequency and spatial fusion with multiscale self-calibration for cattle mounting pose estimation[J]. arXiv: 2603 16596, 2026.

[11]
WU S S, HAN S Q, MO X X, et al. A top-down deep neural network for multi-dairy cows pose estimation and lameness detection[J]. Computers and Electronics in Agriculture, 2025, 239: 110911.

[12]
TAGHAVI M, RUSSELLO H, OUWELTJES W, et al. Cow key point detection in indoor housing conditions with a deep learning model[J]. Journal of Dairy Science, 2024, 107(4): 2374-2389.

[13]
WEI Y F, ZHANG H M, GONG C L, WANG D, YE M, JIA Y P. Study of pose estimation based on spatio-temporal characteristics of cow skeleton[J]. Agriculture, 2023, 13(8): 1535.

[14]
BARNEY S, DLAY S, CROWE A, et al. Deep learning pose estimation for multi-cattle lameness detection[J]. Scientific Reports, 2023, 13: 4499.

[15]
FAN Q C, LIU S C, LI S Q, et al. Bottom-up cattle pose estimation via concise multi-branch network[J]. Computers and Electronics in Agriculture, 2023, 211: 107945.

[16]
黄筠竹, 李亚萍, 张康, 等. 基于遮挡环境下的奶牛腿部跟踪与跛行智能检测方法[J]. 农业工程学报, 2024, 40(24): 179-189.

HUANG J Z, LI Y P, ZHANG K, et al. Leg tracking and lameness intelligent detection method for dairy cows based on occlusion environment[J]. Transactions of the Chinese Society of Agricultural Engineering, 2024, 40(24): 179-189.

[17]
张欣冉, 王新忠, 周奎州, 等. 基于改进YOLO11n的复杂环境下多目标奶牛日常行为检测[J]. 农业工程学报, 2025, 41(14): 155-164.

ZHANG X R, WANG X Z, ZHOU K Z, et al. Daily behaviour detection of multi-target dairy cows based on improved YOLO11n in complex environment[J]. Transactions of the Chinese Society of Agricultural Engineering, 2025, 41(14): 155-164.

[18]
ZHAO E M, CHEN B B, ZHAO H Y, et al. Lightweight cattle pose estimation with fusion of reparameterization and an attention mechanism[J]. PLoS One, 2024, 19(8): e0306530.

[19]
WANG C Y, MARK LIAO H Y, WU Y H, et al. CSPNet: a new backbone that can enhance learning capability of CNN[C]// 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). Piscataway, New Jersey, USA: IEEE, 2020: 1571-1580.

[20]
LIN T Y, DOLLAR P, GIRSHICK R, et al. Feature pyramid networks for object detection[C]// 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). Piscataway, New Jersey, USA: IEEE, 2017: 936-944.

[21]
LIU S, QI L, QIN H F, et al. Path aggregation network for instance segmentation[C]// 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Piscataway, New Jersey, USA: IEEE, 2018: 8759-8768.

[22]
LIU Y, SUN P, WERGELES N, et al. A survey and performance evaluation of deep learning methods for small object detection[J]. Expert Systems with Applications, 2021, 172: 114602.

[23]
SUN K, XIAO B, LIU D, et al. Deep high-resolution representation learning for human pose estimation[C]// 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Piscataway, New Jersey, USA: IEEE, 2019: 5686-5696.

[24]
LIN T Y, MAIRE M, BELONGIE S, et al. Microsoft COCO: common objects in context[C]// Computer Vision – ECCV 2014. Cham, Germany: Springer, 2014: 740-755.

[25]
GUO M H, XU T X, LIU J J, et al. Attention mechanisms in computer vision: a survey[J]. Computational Visual Media, 2022, 8(3): 331-368.

[26]
HU J, SHEN L, SUN G. Squeeze-and-excitation networks[C]// 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Piscataway, New Jersey, USA: IEEE, 2018: 7132-7141.

[27]
WANG Q L, WU B G, ZHU P F, et al. ECA-net: efficient channel attention for deep convolutional neural networks[C]// 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Piscataway, New Jersey, USA: IEEE, 2020: 11531-11539.

[28]
WOO S, PARK J, LEE J Y, et al. CBAM: convolutional block attention module[C]// Computer Vision – ECCV 2018. Cham, Germany: Springer, 2018: 3-19.

[29]
YANG L X, ZHANG R Y, LI L D, et al. SimAM: A simple, parameter-free attention module for convolutional neural networks[C]// International Conference on Machine Learning. New York, USA: PMLR, 2021: 11863-11874.

[30]
HAN G G, HUANG S L, ZHAO F, et al. SIAM: A parameter-free, spatial intersection attention module[J]. Pattern Recognition, 2024, 153: 110509.

[31]
LUO Z J, CAI S F, CUI C, et al. Adaptive knowledge driven regularization for deep neural networks[J]. 35th AAAI Conference on Artificial Intelligence, AAAI 2021, 2021, 10A.: 8810-8818.

[32]
LV C, MA G Y. PoseNet++: a multi-scale and optimized feature extraction network for high-precision human pose estimation[J]. PLoS One, 2025, 20(6): e0326232.

[33]
TIAN Y J, YE Q X, DOERMANN D. YOLOv12: attention-centric real-time object detectors[EB/OL]. arXiv: 2502.12524, 2025.

[34]
LEI M Q, LI S Q, WU Y H, et al. YOLOv13: real-time object detection with hypergraph-enhanced adaptive visual perception[EB/OL]. arXiv: 2506.17733, 2025.

文章导航

/