中文

CREMD: Crowd-Sourced Emotional Multimodal Dogs 数据集

计算机视觉与模式识别 2026-02-18 v1

摘要

狗情绪识别在增强人与动物的互动、改善兽医护理以及开发用于监测犬类福祉的自动化系统方面发挥着关键作用。然而,由于情绪评估的主观性质以及缺乏标准化的真实标注方法,准确解释犬情绪具有挑战性。我们提出了 CREMD(Crowd-sourced Emotional Multimodal Dogs 数据集),一个全面的数据集,探讨了不同的呈现模式(例如情境、音频、视频)以及标注者特征(例如犬类所有权、性别、专业经验)如何影响犬情绪的感知和标注。该数据集由 923 个视频片段组成,呈现为三种 distinct 模式:无情境或音频、有情境无音频、有情境有音频。我们分析了来自不同参与者(包括犬类所有者、专业人士以及具有不同人口统计背景和经验水平的个体)的标注,以识别影响可靠犬情绪识别的因素。我们的发现揭示了几个关键见解:(1) 虽然增加视觉情境显著改善了标注一致性,但关于音频线索的发现因设计限制(具体而言是缺乏无情境-有音频条件以及可用干净音频的限制)而不够确定;(2) 与预期相反,非所有者和男性标注者的一致性水平高于犬类所有者和女性标注者,专业人士的一致性水平更高,这与我们的初始假设一致;(3) 音频的存在显著增加了标注者在识别特定情绪(尤其是愤怒和恐惧)时的信心水平。

关键词

引用

@article{arxiv.2602.15349,
  title  = {CREMD: Crowd-Sourced Emotional Multimodal Dogs Dataset},
  author = {Jinho Baek and Houwei Cao and Kate Blackwell},
  journal= {arXiv preprint arXiv:2602.15349},
  year   = {2026}
}

备注

Submitted to arXiv