DiaDem:面向多模态大语言模型的音视频字幕对话描述提升
计算与语言
2026-01-28 v1
摘要
在音视频字幕生成中,准确的对话描述对于下游的理解和生成任务至关重要。然而,现有模型通常难以在音视频字幕中生成忠实的对话描述。为缓解这一局限,我们提出了DiaDem,一个强大的音视频字幕生成模型,能够在保持整体强劲性能的同时,生成具有更精确对话描述的字幕。我们首先合成了一个高质量的监督微调(SFT)数据集,然后采用一种难度分区的两阶段GRPO策略来进一步增强对话描述。为了实现对对话描述能力的系统评估,我们引入了DiaDemBench,一个全面的基准测试,旨在评估模型在多样化对话场景下的表现,重点关注音视频字幕中说话者归因的准确性和话语转录的保真度。在DiaDemBench上进行的大量实验表明,即使是商业模型在对话感知字幕生成方面仍有很大的改进空间。值得注意的是,DiaDem不仅在对话描述准确性上优于Gemini系列,还在通用音视频字幕基准测试中取得了有竞争力的性能,证明了其整体有效性。
引用
@article{arxiv.2601.19267,
title = {DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models},
author = {Xinlong Chen and Weihong Lin and Jingyun Hua and Linli Yao and Yue Ding and Bozhou Li and Bohan Zeng and Yang Shi and Qiang Liu and Yuanxing Zhang and Pengfei Wan and Liang Wang and Tieniu Tan},
journal= {arXiv preprint arXiv:2601.19267},
year = {2026}
}
备注
Project webpage: https://diadem-captioner.github.io/