超越离散类别:用于宠物发声分析的多任务效价-唤醒建模
声音
2025-10-16 v1 人工智能
音频与语音处理
摘要
传统的基于离散分类的宠物发声情感识别难以处理模糊性并捕捉强度变化。我们提出了一种连续的效价-唤醒(VA)模型,该模型在二维空间中表示情感。我们的方法使用自动VA标签生成算法,能够对42,553个宠物发声样本进行大规模标注。一个多任务学习框架联合训练VA回归与辅助任务(情感、体型、性别),通过改进特征学习来增强预测。我们的音频Transformer模型实现了验证集效价皮尔逊相关系数r = 0.9024和唤醒度r = 0.7155,有效解决了“领地性”和“快乐”等离散类别之间的混淆。这项工作引入了第一个用于宠物发声分析的连续VA框架,为人宠互动、兽医诊断和行为训练提供了更具表现力的表示。该方法在AI宠物情感翻译器等消费产品中显示出强大的部署潜力。
引用
@article{arxiv.2510.12819,
title = {Beyond Discrete Categories: Multi-Task Valence-Arousal Modeling for Pet Vocalization Analysis},
author = {Junyao Huang and Rumin Situ},
journal= {arXiv preprint arXiv:2510.12819},
year = {2025}
}
备注
24 pages, 6 figures, 4 tables. First continuous VA framework for pet vocalization analysis with 42,553 samples