阵列式-LLM:我漏听了什么?哪里?什么时候?
音频与语音处理
2025-09-09 v1 人工智能
计算与语言
人机交互
摘要
我们提出Beamforming-LLM系统,使用户能够在多说话者环境中语义化地回忆自己可能漏听的对话内容。该系统将使用阵列式音频捕获,结合检索增强生成(Retrieval-Augmented Generation, RAG),以支持自然语言查询,例如:“我在关注关于狗的对话时漏听了什么?”通过阵列式波束成形分离方向音频流,用Whisper进行转录,并使用句子编码器将其嵌入向量数据库。收到用户查询后,检索语义相关片段,随后在非关注片段中进行时间对齐,并使用轻量级大语言模型(GPT-4o-mini)进行摘要。结果是一个用户友好的界面,提供对比摘要、空间上下文和带时间戳的音频播放。该工作为智能听觉记忆系统奠定了基础,具有广泛的应用前景,包括辅助技术、会议摘要和上下文感知的个人空间计算。
引用
@article{arxiv.2509.06221,
title = {Beamforming-LLM: What, Where and When Did I Miss?},
author = {Vishal Choudhari},
journal= {arXiv preprint arXiv:2509.06221},
year = {2025}
}