中文

莫拉维斯悖论:向听觉图灵测试

人工智能 2025-08-01 v1 声音 音频与语音处理

摘要

本研究表明,当前AI系统在人类轻易完成的听觉任务上会出现灾难性失败。以莫拉维斯悖论(即人类简单完成的任务往往对机器困难,反之亦然)为灵感,我们引入一个听觉图灵测试,包含917个挑战,涵盖七个类别:重叠语音、噪声中的语音、时序失真、空间音频、咖啡店噪声、电话失真和感知幻觉。我们评估了最先进的音频模型,包括GPT-4的音频功能和OpenAI的Whisper,发现其失败率超过93%,即使表现最好的模型在人类成功率高出7.5倍(52%)的任务上也仅实现6.9%的准确率。这些结果揭示了AI系统在处理复杂听觉场景时的注意力聚焦失败,尤其是在选择性注意、噪声鲁棒性和情境适应方面。我们的基准不仅量化了人机听觉之间的差距,还提供了这些失败发生原因的洞见,表明当前架构缺乏实现类人听觉场景分析的基本机制。传统的音频CAPTCHA设计突显了人类进化出的常见过滤器,而机器学习模型往往难以选择。本工作建立了一个诊断框架,用于衡量向类人水平机器听力的进展,凸显了需要将选择性注意、基于物理的音频理解和情境感知集成到多模态AI系统中的必要性。

关键词

引用

@article{arxiv.2507.23091,
  title  = {Moravec's Paradox: Towards an Auditory Turing Test},
  author = {David Noever and Forrest McKee},
  journal= {arXiv preprint arXiv:2507.23091},
  year   = {2025}
}