中文

EgoNormia:用于基准测试物理社交规范理解

计算机视觉与模式识别 2025-06-13 v5 人工智能 计算与语言

摘要

人类活动受到规范的调节;然而,针对规范推理的监督稀缺,尤其是当规范是物理或社会导向时。因此,我们提出了 EGONORMIA $\|\epsilon\|,其中包含 1853 份(其中 200 份为 EGONORMIA-verified)基于以太非视频中人类互动的多选题(MCQs),用于评估和改进视觉语言模型(VLMs)的规范推理。EGONORMIA 覆盖七类规范:安全、隐私、近距离接触、礼貌、合作、协调/主动性以及沟通/可理解性。为大规模构建此数据集,我们提出了一种新颖的管道,从原始太非视频中生成基于情境的 MCQs。我们的工作表明,当前最先进的 VLMs 在基于情境的规范理解方面欠佳,在 EGONORMIA 上最高得分 54%,在 EGONORMIA-verified 上最高得分 65%,且在各规范类别上的表现表明在 VLMs 用于实际智能体时存在显著的安全和隐私风险。我们还探索了改进规范理解的方法,证明使用 EGONORMIA 进行基于检索的生成(RAG)方法可增强 VLMs 的规范推理。

关键词

引用

@article{arxiv.2502.20490,
  title  = {EgoNormia: Benchmarking Physical Social Norm Understanding},
  author = {MohammadHossein Rezaei and Yicheng Fu and Phil Cuvin and Caleb Ziems and Yanzhe Zhang and Hao Zhu and Diyi Yang},
  journal= {arXiv preprint arXiv:2502.20490},
  year   = {2025}
}

备注

V4, fixes to title and formatting