中文

HuPER:面向语音感知的人类启发框架

音频与语音处理 2026-02-03 v1 人工智能

摘要

我们提出了 HuPER,一个模仿人类感知语音的框架,通过对声学-语音证据和语言知识进行自适应推理来建模语音感知。在仅需100小时训练数据的情况下,HuPER在五个英文基准测试上实现了语音错误率的前沿水平,并对95个不可见语言实现了强大的零样本迁移。HuPER也是首个能够在多样化声学条件下实现自适应、多路径语音感知的框架。所有训练数据、模型和代码均已开源。代码和演示可在 https://github.com/HuPER29/HuPER 查看。

关键词

引用

@article{arxiv.2602.01634,
  title  = {HuPER: A Human-Inspired Framework for Phonetic Perception},
  author = {Chenxu Guo and Jiachen Lian and Yisi Liu and Baihe Huang and Shriyaa Narayanan and Cheol Jun Cho and Gopala Anumanchipalli},
  journal= {arXiv preprint arXiv:2602.01634},
  year   = {2026}
}