CineSRD:利用视觉、声学与语言线索进行开放场景视觉媒体说话人分割
计算机视觉与模式识别
2026-03-19 v1 人工智能
多媒体
声音
音频与语音处理
摘要
传统的说话人分割系统主要聚焦于受限场景,如会议和访谈,此时说话人数量有限且声学环境相对整洁。为探索开放场景的说话人分割,我们将此任务扩展到视觉媒体领域,涵盖复杂的音视频节目,如电影和电视剧。这一新设置引入了若干挑战,包括长视频理解、说话人数量大规模、音视频线索之间的跨模态时序错位,以及野外不可控的变异性。为应对这些挑战,我们提出了Cinematic Speaker Registration & Diarization(CineSRD),一个统一的多模态框架,利用来自视频、语音和字幕的视觉、声学和语言线索进行说话人标注。CineSRD首先进行视觉锚聚类,以注册初始说话人,然后集成基于音频的语言模型进行说话人轮次检测,细化标注并补充未被注册的非屏幕说话人。此外,我们构建并公开了一个专为视觉媒体说话人分割而设的基准数据集,包含中文和英文节目。实验结果表明,CineSRD在该基准数据集上取得优异表现,并在传统数据集上取得具竞争力的结果,验证了其在开放场景视觉媒体设置下的鲁棒性和可泛化性。
引用
@article{arxiv.2603.16966,
title = {CineSRD: Leveraging Visual, Acoustic, and Linguistic Cues for Open-World Visual Media Speaker Diarization},
author = {Liangbin Huang and Xiaohua Liao and Chaoqun Cui and Shijing Wang and Zhaolong Huang and Yanlong Du and Wenji Mao},
journal= {arXiv preprint arXiv:2603.16966},
year = {2026}
}
备注
Accepted to CVPR 2026