CLAIR-A: 利用大语言模型判断音频描述
计算与语言
2025-08-12 v2 声音
音频与语音处理
摘要
自动音频描述 (AAC) 任务要求模型生成对音频输入的自然语言描述。评估这些机器生成的音频描述是一个复杂任务,需要考虑诸多因素,其中包括听觉场景理解、声音-对象推断、时序连贯性以及场景环境背景。虽然当前方法聚焦于特定方面,常常未能提供与人类判断相符的整体评分。本工作提出 CLAIR-A,一种简单且灵活的方法,利用大语言模型 (LLM) 的零样例能力,直接要求 LLM 提供语义距离评分来评估候选音频描述。在我们的评估中,CLAIR-A 在预测人类判断方面优于传统指标,较领域特定 FENSE 指标提高了 5.8% 相对准确率,较最佳通用度量提升最高可达 11%。此外,CLAIR-A 提供了更大的透明度,允许语言模型解释其评分依据,这些解释在人类评估中比基线方法好最高可达 30%。CLAIR-A 已公开发布,地址为 https://github.com/DavidMChan/clair-a。
引用
@article{arxiv.2409.12962,
title = {CLAIR-A: Leveraging Large Language Models to Judge Audio Captions},
author = {Tsung-Han Wu and Joseph E. Gonzalez and Trevor Darrell and David M. Chan},
journal= {arXiv preprint arXiv:2409.12962},
year = {2025}
}
备注
Accepted to ASRU 2025; Code is publicly available at https://github.com/DavidMChan/clair-a