情感视觉对话:基于视觉锚定对话的情感推理大规模基准
计算与语言
2025-01-03 v3
摘要
我们提出情感视觉对话(Affective Visual Dialog),一项情感解释与推理任务,作为研究视觉锚定对话中情感形成机制的平台。该任务涉及三种能力:(1) 基于对话的问答;(2) 基于对话的情感预测;(3) 基于对话的情感解释生成。我们的核心贡献是收集了一个大规模数据集,称为 AffectVisDial,包含 5 万段 10 轮视觉锚定对话,以及总结性情感归因和对话驱动的文本情感解释,总计 27180 个工作时。我们解释了收集该数据集时的设计决策,并引入了与对话参与者相关的提问者与回答者任务。我们训练并展示了改编自最先进(SOTA)模型的稳健情感视觉对话基线。值得注意的是,我们的模型生成的回复在应对视觉锚定对话时展现出有前景的情感推理能力。我们的项目页面位于 https://affective-visual-dialog.github.io。
引用
@article{arxiv.2308.16349,
title = {Affective Visual Dialog: A Large-Scale Benchmark for Emotional Reasoning Based on Visually Grounded Conversations},
author = {Kilichbek Haydarov and Xiaoqian Shen and Avinash Madasu and Mahmoud Salem and Li-Jia Li and Gamaleldin Elsayed and Mohamed Elhoseiny},
journal= {arXiv preprint arXiv:2308.16349},
year = {2025}
}