中文

面向可靠大型音频语言模型的探索

计算机科学与博弈论 2025-05-27 v1

摘要

近期大型音频语言模型(LALM)的进展展示了在语音、音乐和一般声音领域实现惊人成果和前景的潜力。然而,这些模型仍缺乏识别知识边界并主动拒绝回答不确定问题的能力。虽然已有成功尝试提升LLM可靠性,但可靠的LALM研究仍不足。本文系统性地调查了 various 方法以实现可靠LALM,包括训练自由方法,如多模态链式思考(MCoT),以及训练基方法,如监督微调(SFT)。此外,我们识别了先前评估指标的局限性,并提出了新的指标——可靠性提升指数(RGI),用于评估不同可靠方法的效果。我们的发现表明,训练自由方法和训练基方法在不同程度上都提高了LALM的可靠性。而且,我们发现可靠性意识是一种“元能力”,可在不同音频模态之间传递,尽管声音、音乐和语音之间存在显著的结构和内容差异。

关键词

引用

@article{arxiv.2505.19298,
  title  = {Market Clearing with Semi-fungible Assets},
  author = {Theo Diamandis and Tarun Chitra and Guillermo Angeris},
  journal= {arXiv preprint arXiv:2505.19298},
  year   = {2025}
}