CodecBench:用于声学与语义评估的综合基准
音频与语音处理
2025-08-29 v1 声音
摘要
随着多模态大语言模型(LLM)的兴起,音频编解码器在将音频编码为离散标记方面发挥着日益重要的作用,从而实现了音频融合到基于文本的 LLM 中的可能性。当前的音频编解码器捕获两种类型的信息:声学信息和语义信息。由于音频编解码器被应用于语音语言模型中的各种场景,它需要建模日益复杂的信息并适应多变的上下文环境,例如包含多个说话者、背景噪声或更丰富的语义信息的场景。然而,现有的音频编解码器评估受限于简单化的指标和场景,现有的音频编解码器基准测试不用于复杂的应用场景,这限制了其在复杂数据集上进行声学和语义能力评估的水平。我们引入 CodecBench,一个全面的评估数据集,用于从声学和语义两个角度评估音频编解码器性能。通过该基准,我们旨在识别当前局限性、凸显未来研究方向,并推动音频编解码器开发的进展。该代码可在 https://github.com/RayYuki/CodecBench 获取。
引用
@article{arxiv.2508.20660,
title = {CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation},
author = {Ruifan Deng and Yitian Gong and Qinghui Gao and Luozhijie Jin and Qinyuan Cheng and Zhaoye Fei and Shimin Li and Xipeng Qiu},
journal= {arXiv preprint arXiv:2508.20660},
year = {2025}
}