中文

探测难以察觉的对象:评估当前防欺认证方法对无缝语音编辑的有效性

高能天体物理现象 2025-02-05 v2

摘要

神经语音编辑的进展引发了对其滥用进行欺骗攻击的担忧。传统的部分编辑语音语料库主要关注切贴编辑,虽然保持说话人一致性,但常引入可检测的连续性不足。近期方法如 A\textsuperscript{3}T 和 Voicebox 通过利用上下文信息改进了过渡效果。为促进防欺认证研究,我们引入了语音填充编辑 (Speech INfilling Edit, SINE) 数据集,由 Voicebox 创建。我们详细描述了重新实现 Voicebox 训练和数据集创建过程。主观评估确认,使用该新技术编辑的语音比传统切贴方法更难以检测。尽管人类难以辨别,实验结果表明自监督式检测器在检测、定位以及不同编辑方法的泛化方面均能实现卓越的性能。该数据集及相关模型将公开提供。

关键词

引用

@article{arxiv.2501.03804,
  title  = {Dimming GRS 1915+105 observed with NICER and Insight--HXMT},
  author = {M. Zhou and V. Grinberg and A. Santangelo and C. Bambi and Q. Bu and C. M. Diez and L. Kong and J. F. Steiner and Y. Tuo},
  journal= {arXiv preprint arXiv:2501.03804},
  year   = {2025}
}

备注

Accepted for publication in A&A