听弦外之音:释放大语言模型在语音评估中的推理能力
计算与语言
2026-01-27 v2
摘要
大语言模型(LLM)评判器展现出强大的推理能力,但仅限于文本内容。这使得当前的自动语音到语音(S2S)评估方法依赖于不透明且昂贵的音频语言模型(ALM)。在这项工作中,我们提出了 TRACE(基于音频线索的文本推理评估框架),这是一个新颖的框架,它使 LLM 评判器能够对音频线索进行推理,以实现成本效益高且与人类一致的 S2S 评估。为了展示该框架的优势,我们首先引入了一种人类思维链(HCoT)标注协议,通过将评估分解为明确的维度:内容(C)、音质(VQ)和副语言(P),来提高现有评判基准的诊断能力。利用这些数据,TRACE 构建了廉价音频信号的文本蓝图,并提示 LLM 给出各维度的评判,然后通过确定性策略将其融合为总体评分。TRACE 在与人类评分者的一致性上高于 ALM 和仅使用文本的 LLM 评判器,同时成本效益显著更高。我们将发布 HCoT 标注和 TRACE 框架,以实现可扩展且与人类一致的 S2S 评估。
引用
@article{arxiv.2601.13742,
title = {Hearing Between the Lines: Unlocking the Reasoning Power of LLMs for Speech Evaluation},
author = {Arjun Chandra and Kevin Miller and Venkatesh Ravichandran and Constantinos Papayiannis and Venkatesh Saligrama},
journal= {arXiv preprint arXiv:2601.13742},
year = {2026}
}
备注
EACL 2026 Findings