中文

以人为本:基于人类偏好对齐的高效大音频模型评估

计算与语言 2026-05-04 v1 人工智能 声音

摘要

大型音频模型(LAM)的快速激增需要高效的模型比较方法,然而全面的基准测试成本高昂。为填补这一空白,我们研究了最小子集是否能在降低成本和数据冗余的同时可靠地评估LAM。我们分析了10种子集选择方法,使用18个音频模型在覆盖主要LAM评估维度的40个任务上进行实验,表明仅包含50个样本(0.3%的数据)的子集就能与完整基准分数达到超过0.93的皮尔逊相关性。为了理解这些分数与从业者最终关心的用户满意度之间的吻合程度,我们收集了来自真实语音助手对话的776个人类偏好评级,发现子集和完整基准与人类的相关性都仅为0.85。为了更好地预测偏好,我们在这些选定的子集上训练了回归模型,达到了0.98的相关性——优于在随机子集和完整基准上训练的回归模型。这表明在回归建模中,精心筛选的子集比完整基准预测得更好,体现了质量优于数量。我们将这些回归加权的子集作为HUMANS基准开源,这是一个高效的LAG评估代理,能够同时捕捉基准性能和用户偏好。

关键词

引用

@article{arxiv.2605.00022,
  title  = {Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment},
  author = {Woody Haosheng Gan and William Held and Diyi Yang},
  journal= {arXiv preprint arXiv:2605.00022},
  year   = {2026}
}

备注

Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics