为LLM赋予方向性多说话人语音理解能力
计算与语言
2026-02-10 v1 声音
摘要
近期研究表明,通过为大语言模型(LLM)提供音频编码,可实现有效的语音理解能力。然而,大多数语音LLM是在单通道、单说话人数据上训练的,这使得直接将其应用于多说话人和多通道语音理解任务具有挑战性。本文针对LLM的方向性多说话人语音理解能力进行了全面调查,具体针对智能眼镜应用场景。我们提出两种新方法将直接性集成到LLM中:(1)一个级联系统,利用源分离前端模块;(2)一个端到端系统,利用序列化输出训练。所有方法都利用嵌入在智能眼镜中的多麦克风阵列,以优化方式解释和处理以流式方式进行。实验结果表明,我们提出的方法在为LLM赋予方向性语音理解能力方面有效,在语音识别和语音翻译任务中均表现出强性能。
引用
@article{arxiv.2602.07211,
title = {Equipping LLM with Directional Multi-Talker Speech Understanding Capabilities},
author = {Ju Lin and Jing Pan and Ruizhi Li and Ming Sun and Yuzong Liu and Alaa Hassan and Jing Zheng and Florian Metze},
journal= {arXiv preprint arXiv:2602.07211},
year = {2026}
}