UniTalk:面向真实世界场景的通用主动说话人检测
计算机视觉与模式识别
2025-05-29 v1 人工智能
摘要
我们提出了 UniTalk,一个专门为主动说话人检测任务设计的新数据集,强调具有挑战性的场景以增强模型泛化能力。不同于以往建立的基准(如 AVA)主要以老电影为内容从而表现出显著的领域差异,UniTalk 明确聚焦于多样且困难的真实世界条件。这些条件包括代表性不足的语言、嘈杂背景和拥挤场景——例如多个可见说话人同时发言或交叠轮流发言。该数据集包含超过 44.5 小时的视频,具有跨 48,693 个说话身份的帧级主动说话人标注,并涵盖反映真实世界条件的广泛视频类型。通过严格评估,我们表明 SOTA 模型虽然在 AVA 上取得近乎完美的分数,但在 UniTalk 上未能达到饱和,表明 ASD 任务在现实条件下仍远未解决。尽管如此,在 UniTalk 上训练的模型对 Talkies 和 ASW 等现代“in-the-wild”数据集以及 AVA 表现出更强的泛化能力。因此,UniTalk 为主动说话人检测建立了一个新基准,为研究人员开发和评估通用且鲁棒的模型提供了宝贵资源。数据集:https://huggingface.co/datasets/plnguyen2908/UniTalk-ASD 代码:https://github.com/plnguyen2908/UniTalk-ASD-code
引用
@article{arxiv.2505.21954,
title = {UniTalk: Towards Universal Active Speaker Detection in Real World Scenarios},
author = {Le Thien Phuc Nguyen and Zhuoran Yu and Khoa Quang Nhat Cao and Yuwei Guo and Tu Ho Manh Pham and Tuan Tai Nguyen and Toan Ngo Duc Vo and Lucas Poon and Soochahn Lee and Yong Jae Lee},
journal= {arXiv preprint arXiv:2505.21954},
year = {2025}
}