面向多区域语音填充取证的细粒度方法:数据集、方法与指标
声音
2026-05-20 v1 计算机视觉与模式识别
摘要
近期语音克隆和文本转语音合成技术进步,使得部分语音操纵——即对话中替换几个单词以改变其含义而保留说话人身份——成为日益现实的威胁。现有音频深度伪造检测基准关注utterance级别的二分类或单区域操纵,缺乏检测和定位多个未知数量先验的inpainted片段的能力。我们通过三个贡献弥补这一缺口:首先,我们引入 MIST (Multiregion Inpainting Speech Tampering),一个规模庞大的多语言数据集,覆盖 6 种语言,每个utterance包含 1-3 个独立inpainted的单词级片段,通过 LLM 指导的语义替换和神经语音克隆生成,虚假内容仅占每个utterance的 2%-7%。其次,我们提出 ISA (Iterative Segment Analysis),一个基于 backbone 的框架,采用粗到细滑动窗口分类、容忍间隙的区域提议和边界细化,以无需区域数量先验的方式恢复所有被篡改区域。最后,我们定义 SF1@tau,一个基于时间 IoU 匹配的片段级 F1 指标,联合评估区域数量准确性和定位精度。零样本评估显示,词级粗略填充仍未被现有深度伪造检测器解决:在 MIST 中,仅有 2%-7% 内容被操纵的utterance,utterance级别分类器在完全合成语音上训练后,对其几乎没有假概率。ISA 在这一具有挑战性的设置下持续优于非迭代基线,数据集、代码和评估工具包已公开发布。
引用
@article{arxiv.2605.02223,
title = {Toward Fine-Grained Speech Inpainting Forensics:A Dataset, Method, and Metric for Multi-Region Tampering Localization},
author = {Tung Vu and Yen Nguyen and Hai Nguyen and Cuong Pham and Cong Tran},
journal= {arXiv preprint arXiv:2605.02223},
year = {2026}
}