中文

D-ORCA:面向鲁棒音视频字幕的对话中心优化的 Omni 模态大语言模型

计算机视觉与模式识别 2026-02-10 v1

摘要

口头对话是视频中主要的信息来源,因此准确识别谁人、何时说了什么对于深层视频理解至关重要。我们引入 D-ORCA,一个 \textbf{d}ialogue-centric \textbf{o}mni-modal large language model optimized for \textbf{r}obust audio-visual \textbf{ca}ptioning。我们进一步策划了 DVD 数据集,一个大规模高质量的双语数据集,几乎包含 4 万个多方对话视频用于训练,2000 个视频用于评估(英文和中文),弥补了开源生态系统中的关键缺口。为确保细粒度字幕精度,我们采用组相对策略优化,并引入三个新奖励函数,以评估说话人归因精度、全局语音内容精度和句子级时间边界对齐。这些奖励来自语音处理中广泛使用的评估指标,并且据我们所知是首次作为强化学习目标用于音视频字幕。广泛的实验表明,D-ORCA 在说话人识别、语音识别和时间锚定方面显著优于现有开源模型。值得注意的是,尽管 D-ORCA 仅有 80 亿参数,却在多个通用音视频理解基准测试中与 Qwen3-Omni 表现相当。演示可在 \href{https://d-orca-llm.github.io/}{https://d-orca-llm.github.io/} 查看。我们的代码、数据和模型checkpoint将在 \href{https://github.com/WeChatCV/D-ORCA/}{https://github.com/WeChatCV/D-ORCA/} 提供。

关键词

引用

@article{arxiv.2602.07960,
  title  = {D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning},
  author = {Changli Tang and Tianyi Wang and Fengyun Rao and Jing Lyu and Chao Zhang},
  journal= {arXiv preprint arXiv:2602.07960},
  year   = {2026}
}