HuPER:面向语音感知的人类启发框架
音频与语音处理
2026-02-03 v1 人工智能
摘要
我们提出了 HuPER,一个模仿人类感知语音的框架,通过对声学-语音证据和语言知识进行自适应推理来建模语音感知。在仅需100小时训练数据的情况下,HuPER在五个英文基准测试上实现了语音错误率的前沿水平,并对95个不可见语言实现了强大的零样本迁移。HuPER也是首个能够在多样化声学条件下实现自适应、多路径语音感知的框架。所有训练数据、模型和代码均已开源。代码和演示可在 https://github.com/HuPER29/HuPER 查看。
引用
@article{arxiv.2602.01634,
title = {HuPER: A Human-Inspired Framework for Phonetic Perception},
author = {Chenxu Guo and Jiachen Lian and Yisi Liu and Baihe Huang and Shriyaa Narayanan and Cheol Jun Cho and Gopala Anumanchipalli},
journal= {arXiv preprint arXiv:2602.01634},
year = {2026}
}