中文

为何他们记不住?探讨多轮声学记忆中的表示与检索瓶颈

音频与语音处理 2026-05-27 v1 声音

摘要

大型音频语言模型 (LALM) 能处理语音和环境声学线索,但在多轮交互中难以保留非语音信息。语义 (语音) 与声学 (非语音) 理解之间的性能差距尚未得到充分理解,其表示与检索的底层机制仍不清晰。本工作引入 EnvMem,一个受控的多轮基准,旨在研究这一差距并识别失败的根本原因,包括表示层(即潜在嵌入)和检索层(即注意力分配)。我们进一步对结果进行后验干预,以探测表征结构和注意力动态。结果表明,表征轨迹漂移是关键的失败模式,而注意力分配在解释观察到的退化方面发挥的作用有限。总体而言,我们提供了一个系统性的框架,用于分析和改进长上下文 LALM 中的非语言记忆,为健壮的声学记忆建模的未来数据和训练设计提供了启示。

关键词

引用

@article{arxiv.2605.27039,
  title  = {Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory},
  author = {Yang Xiao and Siyi Wang and Han Yin and Hong Jia and Vidhyasaharan Sethu and Eun-Jung Holden and Ting Dang},
  journal= {arXiv preprint arXiv:2605.27039},
  year   = {2026}
}