USTC-NERCSLIP 系统在 CHiME-9 MCoRec 挑战赛中的成绩报告
音频与语音处理
2026-03-03 v1
摘要
本报告详细介绍了我们对 CHiME-9 MCoRec 挑战赛的提交方案,旨在识别和聚类室内社交场景中多个并行自然对话。与传统以单一主题为中心的会议不同,本场景包含最多八位说话者、最多四个同步对话,语音重叠率超过 90%。为应对这一挑战,我们提出了一种多模态级联系统,利用来自同步 360 度视频的逐说话者视觉流与单通道音频。该系统通过利用增强的音视频预训练模型提升了三个管道组件:主动说话人检测(ASD)、音视频目标语提取(AVTSE)和音视频语音识别(AVSR)。AVSR 模块进一步整合了 Whisper 和 LLM 技术以提升转录准确率。我们最佳的单一级联系统在开发集上实现了 32.44% 的说话者词错误率(WER)。通过进一步应用 ROVER 融合来自多样化前端和后端变体的输出,我们将说话者 WER 降至 31.40%。值得注意的是,我们基于 LLM 的零样本对话聚类实现了 1.0 的说话者聚类 F1 分数,最终实现了 15.70% 的联合 ASR-聚类错误率(JACER)。
引用
@article{arxiv.2603.01415,
title = {The USTC-NERCSLIP Systems for the CHiME-9 MCoRec Challenge},
author = {Ya Jiang and Ruoyu Wang and Jingxuan Zhang and Jun Du and Yi Han and Zihao Quan and Hang Chen and Yeran Yang and Kongzhi Zheng and Zhuo Chen and Yanhui Tu and Shutong Niu and Changfeng Xi and Mengzhi Wang and Zhongbin Wu and Jieru Chen and Henghui Zhi and Weiyi Shi and Shuhang Wu and Genshun Wan and Jia Pan and Jianqing Gao},
journal= {arXiv preprint arXiv:2603.01415},
year = {2026}
}