中文

BQA:用于评估视频大语言模型肢体语言理解能力的数据集

计算与语言 2025-08-20 v3

摘要

让当前视频大语言模型准确解读肢体语言是一项关键挑战,因为人类无意识的动作很容易导致模型误解其意图。为解决这一问题,我们提出了一个数据集 BQA,这是一个肢体语言问答数据集,用于验证模型能否从包含 26 种情绪标签的肢体语言短视频片段中正确解读情绪。我们评估了多种视频大语言模型在 BQA 上的表现,结果显示理解肢体语言颇具挑战性;对视频大语言模型错误答案的分析表明,某些视频大语言模型会根据视频中个体的年龄组和种族做出显著有偏见的回答。该数据集已公开。

关键词

引用

@article{arxiv.2410.13206,
  title  = {BQA: Body Language Question Answering Dataset for Video Large Language Models},
  author = {Shintaro Ozaki and Kazuki Hayashi and Miyu Oba and Yusuke Sakai and Hidetaka Kamigaito and Taro Watanabe},
  journal= {arXiv preprint arXiv:2410.13206},
  year   = {2025}
}

备注

Accepted to ACL2025 (Main)