中文

EchoDistill:面向鲁棒音频 LLM 的对齐噪声-干净自蒸馏

计算与语言 2026-05-26 v1 人工智能 声音

摘要

音频大语言模型(ALLM)对真实世界噪声极其脆弱,这常导致严重的语义漂移和幻觉。现有的鲁棒性方法主要依赖波形级别的声学增强、答案级别的监督或内部抑制噪声表示。为解决这些问题,我们提出 echodistill,一个基于对齐的噪声-干净自蒸馏框架。echodistill 利用冻结的干净音频教师为推理时的噪声音频学生提供语义参考。具体而言,学生在噪声条件下采样候选响应,以暴露其 test-time 行为。然后通过 group-relative policy optimization(GRPO)优化这些轨迹,其中与教师的 token 级别一致性作为奖励加成。通过对齐噪声学生的候选响应与干净语义证据,并应用 audio-aware reward shaping,我们的方法鼓励推理轨迹既正确又真正基于声学。echodistill 在不引入额外推理成本的情况下显著提高了音频 LLM 在复杂噪声下的语义可靠性和任务性能。大量实验表明:(I)相对于最强的基线,echodistill 在强噪声下 GSR 提升平均 4.18%↑。(II)在 Qwen-Omni 上进行的消融实验显示,echodistill 相对于仅使用 GRPO 的变体,在 Acc 提升 3.02%↑,在 Noisy 提升 3.89%↑,在 GSR 提升 4.53%↑。我们的代码已公开于 https://anonymous.4open.science/r/echodistill-10DE。

关键词

引用

@article{arxiv.2605.23954,
  title  = {EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs},
  author = {Liang Lin and Chunxi Luo and Kaiwen Luo and Jie Zhang and Jin Wang and Yuanhe Zhang and Cai Yuchen and Qiankun Li and Gongli Xi and Zhenhong Zhou and Kun Wang and Junhao Dong},
  journal= {arXiv preprint arXiv:2605.23954},
  year   = {2026}
}