中文

上下文即先验:基于贝叶斯启发的非言语智能体意图推断及家猫测试平台

计算机视觉与模式识别 2026-05-01 v1

摘要

现实世界环境中的许多智能体无法通过语言可靠地传达其目标,包括家庭宠物、前语言期婴儿和其他非言语具身智能体。在此类设定下,必须从上下文丰富的环境中的不完整行为观察中推断意图。这造成了一个核心歧义:可观察行为通常是嘈杂的或欠指定的,而上下文提供了强大的先验信息,但如果使用不当,也可能导致脆弱的捷径预测。我们提出了 CatSignal,一个受贝叶斯启发的多模态意图推断概率框架,该框架将空间上下文建模为先验约束,将行为观察建模为证据。我们的方法不是将上下文视为普通的输入特征,而是使用上下文门控的专家乘积公式,从上下文、姿态动力学和声学线索中计算后验意图分布。我们在家庭猫的设定中实例化了这个公式,作为非言语智能体意图推断的一个聚焦的概念验证。在多模态家猫数据集上的留一视频评估下,所提出的先验引导融合达到了 77.72% 的最佳总体准确率,优于特征拼接(71.83%)和更强的后期融合基线。更重要的是,它在模糊情况下显著减少了上下文驱动的捷径失败。虽然更简单的融合策略在宏观 F1 和选择性预测方面仍然具有竞争力,但所提出的模型提供了最强的总体准确率和最佳的基于上下文的捷径坍缩抑制。

引用

@article{arxiv.2604.27445,
  title  = {Context as Prior: Bayesian-Inspired Intent Inference for Non-Speaking Agents with a Household Cat Testbed},
  author = {Wenqian Zhang and Zehao Wang},
  journal= {arXiv preprint arXiv:2604.27445},
  year   = {2026}
}

备注

Accepted to the CVPR 2026 Animal Workshop