中文

ELEGANCE:面向音视频目标说话人提取的高效大语言模型指导

统计力学 2026-02-02 v2

摘要

音视频目标说话人提取(AV-TSE)模型主要依赖目标说话人的视觉线索。然而,人类也会利用语言知识,如语法约束、下一个词预测及对对话的先验认知,以提取目标语音。鼓舞人心的观察让我们提出 ELEGANCE,一种通过三种不同的指导策略将大语言模型(LLM)中的语言知识融入 AV-TSE 模型的新框架:输出语言约束、中间语言预测和输入语言先验。我们在两个 AV-TSE 主干模型上使用 RoBERTa、Qwen3-0.6B 和 Qwen3-4B进行全面实验,证明了我们方法的有效性。在包括视觉线索受损、未见语言、目标说话人切换、增加干扰说话人以及越域测试集等具有挑战性的场景中,显著提升了模型性能。演示页面:https://alexwxwu.github.io/ELEGANCE/。

关键词

引用

@article{arxiv.2511.06287,
  title  = {Ordering in statistical systems on the way to the thermodynamic limit},
  author = {V. I. Yukalov and E. P. Yukalova},
  journal= {arXiv preprint arXiv:2511.06287},
  year   = {2026}
}

备注

Latex file, 31 pages, 5 figures