- 主办单位:
- ISSN:
- 期刊分类:
- 出版周期:
- 投稿量:
- 浏览量:
相关文章
暂无数据
动物姿态分析研究进展
Advances in Animal Pose Analysis
引言
联合国粮农组织(FAO)2025年数据显示,全球牛存栏量约15.8亿头、家禽超过280亿只;《2026年中国宠物行业白皮书(消费报告)》显示,2025年我国城镇犬猫数量已达1.26亿只,消费市场规模达3126亿元。随着动物养殖与饲养规模持续扩大,对动物行为与姿态的智能化识别分析已成为一项重要的研究课题。动物姿态分析技术是以动物为研究对象,借助计算机视觉、侵入式设备及人工智能方法,对动物身体各部位的姿态、运动轨迹和行为模式进行观测、量化与分析,从而反映其生理状态、行为意图、健康水平及情感表达的分析技术,是反映动物生理状态与健康状况的重要手段。分析动物姿态的传统方法依赖人工或传感器监测,存在主观性强、难以规模化等问题。随着深度学习尤其是卷积神经网络与Transformer的发展,动物姿态估计已从人工特征工程转向端到端自动学习。动物姿态识别技术在智慧畜牧养殖、无接触式野生动物保护、家宠饲养等领域展现出巨大的应用潜力。然而,当前研究仍面临多重挑战:一方面,跨物种形态多样性、遮挡问题及大规模标注数据匮乏严重制约了模型性能;另一方面,动物行为与健康状况的解读仍依赖人工观察与经验判断,存在主观性强、响应滞后等问题。近年来,随着深度学习、计算机视觉技术与物联网技术的快速发展,动物姿态分析与行为识别研究取得了关键性进展。
1 动物姿态分析发展
动物姿态分析的核心是从图像或视频中检测到动物,并关联其身体关键点,以重建姿态结构。早期基于传统图像处理的方法依赖人工提取的浅层特征和固定参数,缺乏深层语义挖掘,泛化能力有限,随着DeepLabCut、LEAP、SLEAP等无标记姿态估计框架的提出,显著提升了对动物姿态的数据分析效率和场景适应性,使得人工智能方法在动物姿态分析技术领域被广泛的应用。
动物姿态分析的研究历程的发展脉络可追溯至传统机器视觉时代,随着深度学习,尤其是卷积神经网络的崛起而进入高速发展阶段,近年来,动物姿态研究在模型架构、学习范式与应用部署等多个维度呈现出多元化的演进趋势。我们将其主要分为三个时期。一是传统机器视觉方法主导期。此阶段的研究主要依赖于人工经验提取与统计得到的特征,结合分类器实现行为识别。例如钱蓉等人通过提取动物的轮廓面积、关键点及几何参数,再结合神经网络训练分类模型,实现了对动物饮水、进食等多种行为的识别;二是通用框架迁移期。深度学习技术发展后,在动物姿态估计上广泛应用。张敏等人将姿态估计转化为关键点坐标回归问题。Toshev等人通过Stacked Hourglass Network、CPN等网络通过沙漏结构与多阶段精炼提升了定位精度。此阶段主要基于热图回归的方法,通过全卷积网络生成高分辨率热力图实现了高于传统方法的精度。然而,此阶段的研究主要基于人体姿态,动物姿态多作为通用框架的直接迁移应用,缺乏针对动物的专用设计。三是专用化框架发展时期。Newell等人通过迁移学习,应用DeepLabCut框架解决了模型只对单一物种识别的问题,并降低了模型对大量数据标注的依赖。而Sun等人采用HRNet保持高分辨率特征流,提升了关键点定位精度。同时,Yan等人引入GCN构建关键点间的拓扑关系,增强了结构化的预测能力。Dosovitskiy等人在 Vision Transformer的基础上,通过自注意力机制捕获长程依赖,提升了模型在复杂背景下的鲁棒性。在此阶段,动物姿态估计从简单移植人体方法,逐渐发展为融合了动物行为学、跨物种迁移学习与领域自适应的综合性研究。
目前,多尺度融合与改变注意力机制、引入时序与图结构学习、数据迁移、小样本学习、模型轻量化与边缘部署是动物姿态估计模型的主要优化方向。然而,动物识别模型仍在复杂遮挡、跨物种姿态泛化、动态姿态估计以及多动物交互分析等场景存在分析缺陷。
基于视觉的动物姿态分析技术大致涵盖目标检测、姿态估计、行为分类三个子领域。目标检测负责定位和识别图像中的动物个体;姿态估计在此基础上刻画其关节、五官等关键点位置,使用3D建模等技术对其姿态表征进行构建。行为分类则结合多维度信息,对进食、跳跃、休息等特殊行为模式进行行为理解与分类。动物姿态分析技术为动物的智能监护、健康管理与交互系统提供了技术路线与研究方向。
2 动物姿态分析关键技术分类
动物姿态分析技术主要围绕身份确认、姿态刻画、行为理解此进程形成的核心逻辑,形成多维度技术架构,各方向结合基础技术实现差异化发展。
2.1 动物身份识别技术
现阶段动物身份识别靠三大核心方法:面部识别和毛发纹理与斑纹识别。面部识别重点抓眼睛、口鼻等关键特征点,传统算法靠SIFT、HoG手工提取特征,后来把注意力机制融入CNN模型,通过毛发纹理与斑纹识别先分割毛发区域,提取灰度共生矩阵这类纹理特征,再搭配SVM分类器做个体区分,专门应对特殊识别场景。
小样本学习结合元学习框架的方案,只用少量标注样本就能适配新动物个体或新物种的识别,直接降低对标注数据的依赖;借助域自适应技术,通过特征分布对齐、对抗训练等操作缩小训练与真实场景的域差异,切实提升模型在真实环境中的鲁棒性。
2.2 动物姿态识别技术
首先是2D姿态估计,主流依托HRNet、YOLOv8等网络,依靠热图回归、坐标回归定位关键点,结合GCN建模骨骼拓扑关系,面对图像或视频中的遮挡、形变问题,还会用注意力机制、多尺度融合、时序约束等办法优化。
其次为3D姿态估计,主要分两种思路。单目视觉靠2D到3D的映射和骨骼先验实现,成本低但受视角影响极大,无法适配复杂视角场景;RGBD-based方法结合深度信息,精度明显提升,适合固定场景使用。
轻量化技术通过通道剪枝、知识蒸馏、量化等模型压缩方法,平衡精度与运行速度,灵活调整优化策略,刚好适配边缘设备部署,不用依赖高性能服务器。
2.3 动物行为识别技术
现在的动物行为识别,核心是基于姿态序列分类:用LSTM、Transformer或GCN建模姿态时序变化,结合行为模板匹配、自监督学习,实现基础行为识别;要么走多模态路线,融合视觉与IMU传感器数据,靠卡尔曼滤波、注意力融合提升复杂场景识别鲁棒性,勉强覆盖大部分家庭场景。
2.4 跨场景与鲁棒性优化技术
通过扩散模型、GAN生成多样化标注数据的合成数据方法,再搭配域自适应方法,缩小合成数据与真实数据的差距,切实解决标注数据不足的痛点。
对于杂场景的应对,通过光照归一化、语义分割、注意力机制等操作,优化光照变化、遮挡、背景干扰下的特征提取效果,让模型跳出实验室理想条件,在真实的家庭环境中稳定发挥。
3 基于YOLO算法的动物姿态分析
动物姿态分析相关技术的快速发展离不开计算机视觉、深度学习等核心技术的支撑,其中以YOLO系列算法为代表的目标检测框架,其凭借高效、精准、易部署的特性,成为动物识别领域的主流技术。
3.1 核心技术支撑
动物识别的目标主要是识别动物目标、提取动物目标特征及判断动物目标身份、姿态、行为等,其技术核心是计算机视觉、深度学习,但同时涉及到多模态数据技术。计算机视觉技术中的图像预处理,如去噪、增亮、尺度归一化,在识别中能去除一些识别的影响;特征提取从传统手工特征到深度学习特征,如传统SIFT、HoG可用于简单环境下的动物外观特征提取;深度学习技术主导的CNN、Transformer特征可自学习地提取出动物面部纹理等高阶特征。
深度学习核心模型中CNN核心使用了ResNet的残差连接、HRNet的多尺度特征以保证识别能力,提升动物的姿态检测精度;目标检测模型中YOLO系列因实时检测的特征常用于嵌入式系统等场景。多模态数据融合技术,这些技术主要是解决单一的视觉数据在遮挡等复杂环境下的局限性。
3.2 YOLO系列算法演进与技术特性
YOLO系列算法中,其特点都是端到端推理、速度与精度相结合,技术发展主要特征是提升特征提取能力、模型轻量化、面向复杂目标等,完美契合动物检测的需要。不同版本的主要特点如下:
YOLOv5:主要特征有FocusLayer保留动物的细节特征、C3模块加强C特征特征聚合与多尺度特征交互、自适应锚框用于适应不同动物的大小、姿态,这些特征使得检测的效率得到了提高;
YOLOv6:主要特征有引入EfficientRep网络支持网络剪枝,改善path聚合网络等,小型动物检测和边缘化网络应用的效果明显。
YOLOv7:主要采用高效层聚合网络丰富特征表示,增加辅助检测头,以便更适合动物复杂姿态、多尺度目标的预测;
YOLOv8:主要升级C2f模块,提升细节捕捉能力,Anchor Free有利于更好地检测不规则姿态,修正损失函数来缓解样本不均衡;
YOLOv9:主要创新点是引入辅助可逆分支技术和PGI技术来生成高质量的梯度,以提升动物姿态估计等精细估计的性能;
YOLOv10:采用轻量级分类头结合大卷积核的机制扩大感受野,没有NMS训练策略,提升检测多动物的能力等。
4 动物姿态分析技术性能对比与应用场景分析
4.1 核心数据集
高质量的动物数据集是动物姿态分析模型训练和模型性能评估的基础,现有数据集中包含有动物身份、姿态、动作等标注信息,是各种应用场景下进行动物识别研究的重要基础数据。如AP-10K作为经典的动物表型分析数据集,主要是用点标注方式涵盖54种动物,为动物姿态估计提供基础;PetImages数据集有较多关于犬和猫的外观图片,可用于宠物身份识别的基础模型训练,但需要与针对性的场景数据集合补充使用。
和经典数据集比,专用数据集的针对性更强。专用于宠物狗3D姿态标注的3DDogs数据集,涵盖实验室与自然场景的多模态数据,能直接支撑单目视觉下的动物3D姿态重建研究;家养宠物行为数据集多是研究者自建,采集家庭环境里的数据后,适配宠物健康监测场景的模型训练。
4.2 主流技术性能对比
在动物识别与姿态分析研究中,模型性能常通过mAP、FPS和IoU等指标进行评估。
为提高识别技术性能,数据质量和数据量的提升均不可或缺。Liu等人发现,引入随机采样机制与空洞卷积结构后有效增强了SSD模型在小尺度动物目标检测任务中的稳定性与鲁棒性。同时,Bochkovskiy等人在YOLOv4中提出了Mosaic数据增强策略与SAT方法,通过重构训练样本分布使模型可学习到常规上下文之外的目标特征进而提升复杂场景下的泛化能力。基于Transformer的端到端检测模型DETR依托全局自注意力机制,在大型动物目标识别方面展现出相较传统卷积神经网络更大的潜力但其在小目标检测性能及模型收敛效率方面仍存在一定不足。在更高精度的像素级分析任务中,Xiong等人提出的Pixel Objectness方法通过联合外观信息与运动流特征,在视频序列中实现了72.82%的平均IoU,为动物目标轮廓的精细分割提供了可靠的支持。Jumaah等人为提高猫狗的情绪识别,构建了专有场景下的精细数据集,并基于YOLO模型进行训练,显著提高了模型在宠物情绪上的分类精度。各模型的性能表现如表1所示。
| 模型 | 数据集 | 准确率 | 推理速度 |
|---|---|---|---|
| SSD | PASCAL VOC2007 | 74.3%mAP | 59 FPS |
| YOLOv4 | MS COCO | 43.5%AP(65.7%AP50) | 65 FPS |
| DETR | MS COCO | 42.0%-44.9%AP | 10-28 FPS |
| Pixel Objectness | DAVIS/ImageNet | 72.82% IoU | 0.6s/img |
| YOLO-Pet | Animals Dataset | 91.0%mAP/96%Acc | 实时处理 |
各类检测模型的实验结果表明,单阶段目标检测算法在实时处理能力方面表现更优且在多尺度检测中效率更高。以SSD模型为例,其在PASCAL VOC2007数据集上达到74.3% mAP,同时保持了59 FPS的推理速度。相比之下,YOLOv4通过引入CSPDarknet53作为主干网络并集成PANet进行特征路径聚合,在MS COCO数据集上取得了43.5%的AP指标,在Tesla V100计算平台下其检测速度可达 65 FPS 左右,在检测精度与实时性能间实现了良好平衡。
4.3 典型应用场景落地情况
结合现有研究成果发现,动物识别技术的实际应用范围正不断扩大。在城市公共安全与智慧监测中,基于YOLO构建的目标检测系统即便在人员密集、光照条件不佳的复杂环境下也能稳定识别猫、狗等动物,为智慧城市中的流浪动物管理以及自动驾驶系统中的动物避障提供关键技术支持。通过对检测网络层级结构进行针对性优化,系统识别准确率可保持在70%至96%的区间内,其能够满足实时监控场景对稳定性和可靠性的要求。
在宠物福利与兽医学评估应用中,动物情感状态识别逐渐成为当前研究的重点方向。研究人员通过分析动物面部表情细节及身体动作特征,利用YOLO-Pet模型可将动物行为划分为快乐、悲伤、兴奋等多种情绪类别,该模型实验取得的91%mAP为动物行为研究提供了较为客观的数据依据。相较于局限性较大的传统接触式监测,这种无需物理接触的监测方式有效规避了佩戴设备可能引发的应激反应,弥补了传统方法在长效数据采集上的不足。
在数字媒体处理与计算机图形学领域中,通用对象分割方法能够在视频序列中自动生成高精度的动物分割掩码,为智能抠图、视频重定向及基于内容的图像检索等提供技术支持。该方法通过学习目标的对象性特征,适用于常见动物类别还能对训练集中未出现的物种实现有效分割,为内容生产的规模化与自动化提供了更为稳健的技术支撑。
5 未来研究趋势与展望
动物姿态分析技术的发展为未来创造更高效、更精准的智能动物管理系统提供了丰富的理论支撑。
对于技术创新,随着生成式AI的发展,收集海量、多样化的数据用于训练将不再是数据集制作的难题。随着边缘原生智能的发展,模型压缩与高效架构设计领域为模型的边缘化提供了理论支撑。另一方面,研究界已开发出如MobileViT、Swin Transformer轻量变体以及Lite Transformer等轻量化模型,未来将有更多轻量化视觉大模型封装进嵌入式设备,使动物姿态分析技术具备实时分析能力。此外,动物识别与姿态分析技术将构建统一的多物种姿态表征,使模型拥有对野生动物的泛化能力。
对于应用层面,动物姿态分析技术将融合视觉、声音、环境等多模态信息,实现更精准的健康与情绪判断。这些进展将共同使动物饲养更加智能化、更加便利。
参考文献:
- [1] 钱蓉,詹凯,王重龙.基于机器视觉技术的动物行为自动识别和分类[J].中国家禽,2016,38(03):55-57.
- [2] 张敏,张恒义,郑筱祥.基于朴素贝叶斯分类器的大鼠体态自动识别[J].航天医学与医学工程,2005(05):370-374.
- [3] Toshev A, Szegedy C. Deeppose: Human pose estimation via deep neural networks[C]//Proceedings of the IEEE conference on computer vision and pattern recognition. 2014.
- [4] Newell A, Yang K, Deng J. Stacked hourglass networks for human pose estimation[C]//European conference on computer vision. 2016.
- [5] Sun K, Xiao B, Liu D, et al. Deep high-resolution representation learning for human pose estimation[C]//Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 2019.
- [6] Yan S, Xiong Y, Lin D. Spatial temporal graph convolutional networks for skeleton-based action recognition[C]//Proceedings of the AAAI conference on artificial intelligence. 2018.
- [7] Dosovitskiy A. An image is worth 16x16 words: Transformers for image recognition at scale[C]//In 9th International Conference on Learning Representations. 2021
- [8] 李谦,成志伟.一种面向宠物健康监测的智能项圈设计与实现[J].电子制作,2025,33(12):39-41.
- [9] Yu H, Xu Y, Zhang J, et al. AP-10K: A Benchmark for Animal Pose Estimation in the Wild [C]//In Proceedings of the Neural Information Processing Systems Track on Datasets and Benchmarks.2021.
- [10] Parkhi O M, Vedaldi A, Zisserman A, et al. Cats and dogs [C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 2012.
- [11] Liu W, Anguelov D, Erhan D, et al. SSD: Single shot multibox detector. In European conference on computer vision[J]. Springer 2016.
- [12] Bochkovskiy A, Wang C Y, Liao H Y M. Yolov4: Optimal speed and accuracy of object detection[J]. arXiv preprint arXiv:2020.10934.
- [13] Carion N, Massa F, Synnaeve G, et al. End-to-end object detection with transformers. In European conference on computer vision[J]. Springer.2020:213-229.
- [14] Xiong B, Jain S D, Grauman K. Pixel objectness: learning to segment generic objects automatically in images and videos[J]. IEEE transactions on pattern analysis and machine intelligence,2018,41(11):2677-2692.
- [15] Jumaah N S. YOLO-based analysis of pet emotional behavior to emotion classification in dogs and cats[J]. Al-Salam journal for engineering and technology, 2025, 4(01):124-134.
- [16] Saharia C, Chan W, Saxena S, et al. Photorealistic text-to-image diffusion models with deep language understanding[J]. Advances in neural information processing systems, 2022, 35: 36479-36494.
- [17] Rombach R, Blattmann A, Lorenz D, et al. High-resolution image synthesis with latent diffusion models[C]. Proceedings of the IEEE/CVF Conference On Computer Vision and Pattern Recognition. 2022.
- [18] Karras T, Aittala M, Aila T, et al. Elucidating the design space of diffusion-based generative models[J]. Advances in neural information processing systems, 2022, 35: 26565-26577.
- [19] Mehta S, Rastegari M. Mobilevit: light-weight, general-purpose, and mobile-friendly vision transformer[J]. arXiv preprint arXiv:2110.02178, 2021.
- [20] Liu Z, Lin Y, Cao Y, et al. Swin transformer: Hierarchical vision transformer using shifted windows[C]//Proceedings of the IEEE/CVF international conference on computer vision. 2021.
- [21] Wu Z, Liu Z, Lin J, et al. Lite transformer with long-short range attention[J]. arXiv preprint arXiv:2004.11886, 2020.
- [22] Cao J, Tang H, Fang H S, et al. Cross-domain adaptation for animal pose estimation[C]//Proceedings of the IEEE/CVF international conference on computer vision. 2019.
- [23] Li J, Wang C, Zhu H, et al. Crowdpose: Efficient crowded scenes pose estimation and a new benchmark[C]//Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 2019.
