中文

HoliAntiSpoof:面向全方位语音防欺的音频大语言模型

声音 2026-02-05 v1

摘要

近期语音合成与编辑技术的进步使得语音欺欺日益具有挑战性。然而,大多数现有方法将欺欺视为二元分类,忽略了多样化的欺欺技术如何操作多个相互关联的语音属性及其语义效应。在本文中,我们引入 HoliAntiSpoof——首个面向全方位语音防欺的音频大语言模型(ALLM)框架。HoliAntiSpoof 将欺欺分析重新表述为统一的文本生成任务,实现对欺欺方法、受影响语音属性及其语义影响的联合推理。为支持语义层面的分析,我们引入 DailyTalkEdit,一个新的防欺基准,模拟现实对话操纵并提供语义影响注释。大量实验表明,HoliAntiSpoof 在多个场景下均超越传统基线方法,而初步结果显示,基于情境的学习进一步提升了跨域泛化能力。这些发现表明,ALLM 不仅提升了语音防欺检测性能,还能实现对欺欺行为及其语义效应的可解释分析,指向更可信、可解释的语音安全。数据与代码已公开。

关键词

引用

@article{arxiv.2602.04535,
  title  = {HoliAntiSpoof: Audio LLM for Holistic Speech Anti-Spoofing},
  author = {Xuenan Xu and Yiming Ren and Liwei Liu and Wen Wu and Baoxiang Li and Chaochao Lu and Shuai Wang and Chao Zhang},
  journal= {arXiv preprint arXiv:2602.04535},
  year   = {2026}
}