ELEGANCE:面向音视频目标说话人提取的高效大语言模型指导
统计力学
2026-02-02 v2
摘要
音视频目标说话人提取(AV-TSE)模型主要依赖目标说话人的视觉线索。然而,人类也会利用语言知识,如语法约束、下一个词预测及对对话的先验认知,以提取目标语音。鼓舞人心的观察让我们提出 ELEGANCE,一种通过三种不同的指导策略将大语言模型(LLM)中的语言知识融入 AV-TSE 模型的新框架:输出语言约束、中间语言预测和输入语言先验。我们在两个 AV-TSE 主干模型上使用 RoBERTa、Qwen3-0.6B 和 Qwen3-4B进行全面实验,证明了我们方法的有效性。在包括视觉线索受损、未见语言、目标说话人切换、增加干扰说话人以及越域测试集等具有挑战性的场景中,显著提升了模型性能。演示页面:https://alexwxwu.github.io/ELEGANCE/。
关键词
引用
@article{arxiv.2511.06287,
title = {Ordering in statistical systems on the way to the thermodynamic limit},
author = {V. I. Yukalov and E. P. Yukalova},
journal= {arXiv preprint arXiv:2511.06287},
year = {2026}
}
备注
Latex file, 31 pages, 5 figures