多模态对话结构理解
计算与语言
2026-01-29 v3
摘要
虽然多模态大语言模型(LLMs)在对话方面表现出色,但它们是否能够充分解析对话结构——对话角色和对话线程——仍然未被充分探索。在这项工作中,我们引入了一套任务并发布了 TV-MMPC,一个新的标注数据集,用于多模态对话结构理解。我们的评估显示,虽然所有多模态 LLMs 都优于我们的启发式基线,但即使是我们考虑的最佳模型在对话角色身份匿名化后也会出现显著的性能下降。除了评估之外,我们还对 TVQA 中的 350,842 条话语进行了社会语言学分析。我们发现,虽然女性角色以与她们说话时间成比例的比例发起对话,但她们被分配为听话者或旁观者的可能性是男性的 1.2 倍,而旁观者的存在将对话语域从个人转向社交。
引用
@article{arxiv.2505.17536,
title = {Multimodal Conversation Structure Understanding},
author = {Kent K. Chang and Mackenzie Hanh Cramer and Anna Ho and Ti Ti Nguyen and Yilin Yuan and David Bamman},
journal= {arXiv preprint arXiv:2505.17536},
year = {2026}
}
备注
accepted to EACL 2026 main conference; 22 pages, 9 figures, 10 tables