面向音频编辑的自动评估与高质量伪平行数据集构建:一种人机循环方法
声音
2026-02-03 v2
摘要
音频编辑旨在根据文本描述对音频内容进行操作,支持添加、删除或替换音频事件等任务。尽管近期取得了进展,但缺乏高质量基准数据集和全面的评估指标仍是评估音频编辑质量以及改进该任务本身的主要挑战。在本工作中,我们提出了一种新方法,通过纳入专家知识来协调评估和数据集构建过程:1) 首先,我们建立了 AuditScore,这是第一个用于主观评估音频编辑的数据集,包含超过 6300 个编辑样本,来自 7 个代表性音频编辑框架和 23 套系统配置。每个样本都由专业评分者在音频编辑质量的三个关键方面进行标注:整体质量、与编辑意图的相关性以及对原始特征的忠实度。2) 基于该数据集,我们系统性地提出了 AuditEval,一套针对音频编辑的 MOS 风格自动评估器,涵盖了 SSL 基于和 LLM 基于方法。这解决了该领域缺乏有效客观指标以及主观评估成本高昂的问题。3) 我们进一步利用 AuditEval 对大量合成混合编辑对进行评估和筛选,挖掘出最可信的样本,构建高质量的伪平行子数据集。全面的实验验证了我们专家信息驱动的过滤策略有效地产生了更高质量的数据,同时也暴露了传统客观指标的局限性以及 AuditEval 的优势。该数据集、代码和工具可在 https://github.com/NKU-HLT/AuditEval 上找到。
引用
@article{arxiv.2508.11966,
title = {Towards Automatic Evaluation and High-Quality Pseudo-Parallel Dataset Construction for Audio Editing: A Human-in-the-Loop Method},
author = {Yuhang Jia and Hui Wang and Xin Nie and Yujie Guo and Lianru Gao and Yong Qin},
journal= {arXiv preprint arXiv:2508.11966},
year = {2026}
}