面向事件驱动活动的视频对话数据集与评估指标
计算机视觉与模式识别
2025-01-31 v1 计算与语言
摘要
本文提出了 VDAct,一个用于事件驱动活动视频对话的数据集,同时引入 VDEval,一个专为该任务设计的基于会话的上下文评估指标。与现有数据集不同,VDAct 包含更长、更复杂的视频序列,描绘多种事件驱动活动,要求对情境进行深入理解才能生成准确的响应。该数据集包含 3000 组对话,超过 30,000 个问答对,源自 1000 部涵盖多样活动情景的视频。VDAct 的一个显著特点是其广泛的活动情景和多样化的问题类型。在针对该数据集进行的经验研究表明,面向视觉基础模型在解决 VDAct 上某些问题类型时存在局限。此外,VDEval 整合了对话历史和从补充知识图中提取的视频内容摘要,用于评估单个响应,其与人类评估之间的相关性显著高于仅依赖单次对话上下文的现有评估指标。
引用
@article{arxiv.2501.18324,
title = {A Video-grounded Dialogue Dataset and Metric for Event-driven Activities},
author = {Wiradee Imrattanatrai and Masaki Asada and Kimihiro Hasegawa and Zhi-Qi Cheng and Ken Fukuda and Teruko Mitamura},
journal= {arXiv preprint arXiv:2501.18324},
year = {2025}
}
备注
Accepted at AAAI2025