中文

面向可靠大型音频语言模型的探索

声音 2025-05-27 v1 计算与语言 人机交互 多媒体 音频与语音处理

摘要

近期大型音频语言模型(LALM)的进展展示了在语音、音乐和一般声音领域实现惊人成果和前景的潜力。然而,这些模型仍缺乏识别知识边界并主动拒绝回答不确定问题的能力。虽然已有成功尝试提升LLM可靠性,但可靠的LALM研究仍不足。本文系统性地调查了 various 方法以实现可靠LALM,包括训练自由方法,如多模态链式思考(MCoT),以及训练基方法,如监督微调(SFT)。此外,我们识别了先前评估指标的局限性,并提出了新的指标——可靠性提升指数(RGI),用于评估不同可靠方法的效果。我们的发现表明,训练自由方法和训练基方法在不同程度上都提高了LALM的可靠性。而且,我们发现可靠性意识是一种“元能力”,可在不同音频模态之间传递,尽管声音、音乐和语音之间存在显著的结构和内容差异。

关键词

引用

@article{arxiv.2505.19294,
  title  = {Towards Reliable Large Audio Language Model},
  author = {Ziyang Ma and Xiquan Li and Yakun Song and Wenxi Chen and Chenpeng Du and Jian Wu and Yuanzhe Chen and Zhuo Chen and Yuping Wang and Yuxuan Wang and Xie Chen},
  journal= {arXiv preprint arXiv:2505.19294},
  year   = {2025}
}

备注

ACL 2025 Findings