基于先验增强音频大语言模型的统一语音编辑检测与内容局部化
声音
2026-05-26 v3 人工智能
摘要
现有的语音编辑检测(SED)数据集主要通过手动拼接或有限的编辑操作构建,导致其多样性受限、对现实编辑场景的覆盖不足。同时,当前的SED方法依赖于帧级监督来检测可见的声学异常,这从根本上限制了其处理删除类型编辑的能力,这类编辑中操纵内容在信号中完全不存在。为解决这些挑战,我们提出了一个通过基于音频大语言模型(Audio LLM)的生成公式统一语音编辑检测与内容局部化的框架。首先,我们引入AiEdit数据集(https://huggingface.co/datasets/JunXueTech/AiEdit),一个覆盖添加、删除和修改操作的大型双语数据集(约140小时),使用最先进的端到端语音编辑系统,为现代威胁提供了更真实的基准。基于此,我们将SED重新表述为结构化文本生成任务,实现对编辑类型识别与内容局部化的联合推理。为增强生成模型对声学证据的 grounding,我们提出了一种先验增强提示策略,将来自帧级检测器派生的词级概率线索注入模型。此外,我们引入了一种声学一致性感知损失,显式地在潜在空间中强化正常与异常声学表征之间的分离。实验结果表明,所提出的方法在检测和局部化任务上均显著优于现有方法。
引用
@article{arxiv.2601.21463,
title = {Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs},
author = {Jun Xue and Yi Chai and Yanzhen Ren and Jinshen He and Zhiqiang Tang and Zhuolin Yi and Yihuan Huang and Yuankun Xie and Yujie Chen},
journal= {arXiv preprint arXiv:2601.21463},
year = {2026}
}