中文

实音信任的侵蚀:大规模人类音频深度伪造感知研究

机器学习 2026-05-27 v1

摘要

音频深度伪造近期快速改進,但其對人類對真實語音信任的影響尚未被研究。本文提出目前為止規模最大的音頻深度伪造感知聽力研究,收集了 35,532 項評斷,涵蓋 1,768 名參與者與 138 個文本轉語音與語音轉換系統。我們的核心發現是信任的轉變:相較於 2021 年基準,人類對偽造樣本的準確率幾乎不變(72.9% 至 71.2%),但對真實樣本的準確率下降了(72.7% 至 64.1%)。參與者並非在偵測合成痕跡方面變差;相反,他們越來越不信任真正的語音。來自商業與自回歸語言模型系統生成的樣本最難以偵測(61.3 - 65.9%),而來自傳統 seq2seq 與流匹配模型的樣本仍較易被發現(75.4 - 76.8%)。作為參考點的機器學習偵測器在所有條件下保持超過 94.5% 的準確率。我們的結果暗示,現代深度伪造的主要威脅可能不僅是 mere 誤欺,更是對真實音頻信任的侵蝕。

关键词

引用

@article{arxiv.2605.26135,
  title  = {SilIF: Silhouette-Augmented Isolation Forest for Unsupervised Transaction Fraud Detection},
  author = {Venkatakrishnan Gopalakrishnan},
  journal= {arXiv preprint arXiv:2605.26135},
  year   = {2026}
}

备注

5 pages, 1 figure, 5 tables. Code: https://github.com/venkat15vk/silif-anomaly-detection