中文

BRACE:面向鲁棒音频标题质量评估的基准

声音 2025-12-12 v1 计算与语言

摘要

自动音频标题生成对于音频理解至关重要,使能于可访问性和内容索引等应用。然而,在缺乏高质量参考标题的 reference-free 设置下,评估音频标题的质量仍是一个主要挑战。尽管CLAPScore目前是最广泛使用的 reference-free Audio Caption Evaluation Metric(ACEM),但其在 diverse conditions下的鲁棒性尚未系统验证。为此,我们引入BRACE,一个新的基准,旨在评估音频标题对齐质量的 reference-free 设置。BRACE主要用于评估ACEM,也可以扩展来衡量大型音频语言模型(LALM)的模态对齐能力。BRACE由两个子基准组成:BRACE-Main用于细粒度的标题比较,BRACE-Hallucination用于检测细微的幻觉内容。我们通过高质量过滤、LLM-based corruption和人工标注来构建这些数据集。鉴于CLAPScore作为 reference-free ACEM的广泛采用以及LALMs在音频语言任务中的日益增长的应用,我们使用BRACE基准评估两种方法,测试CLAPScore在 various CLAP model variants上的表现,并评估多个LALMs。值得注意的是,即使是表现最好的基于CLAP的 ACEM 在 BRACE-Main 基准上也仅达到了 70.01 的 F1 分数,而表现最好的 LALM 仅达到 63.19。通过揭示CLAP模型和LALMs的局限性,我们的BRACE基准为未来研究的方向提供了宝贵的见解。

关键词

引用

@article{arxiv.2512.10403,
  title  = {BRACE: A Benchmark for Robust Audio Caption Quality Evaluation},
  author = {Tianyu Guo and Hongyu Chen and Hao Liang and Meiyi Qiang and Bohan Zeng and Linzhuang Sun and Bin Cui and Wentao Zhang},
  journal= {arXiv preprint arXiv:2512.10403},
  year   = {2025}
}