JCAPT:一种用于CAPT的联合建模方法
计算与语言
2025-07-28 v2 人工智能
音频与语音处理
摘要
有效的发音反馈对于二语学习(L2)至关重要,计算机辅助发音训练(CAPT)系统通常涉及两个关键任务:自动发音评估(APA)和误发音检测与诊断(MDD)。近期研究表明,对这两个任务进行联合建模可产生相互益处。我们的统一框架利用 Mamba——一种选择性状态空间模型(SSM),同时集成音位特征和思考 token 策略,以联合增强 APA 和 MDD 的可解释性和细粒度时序推理。迄今为止,本文是首次将音位归因、基于 SSM 的建模和提示方法结合到 CAPT 中。一系列在 speechocean762 数据集上进行的实验表明,我们的模型在所有指标上都一致优于先前方法,尤其在 MDD 任务上表现尤为突出。
引用
@article{arxiv.2506.19315,
title = {JCAPT: A Joint Modeling Approach for CAPT},
author = {Tzu-Hsuan Yang and Yue-Yang He and Berlin Chen},
journal= {arXiv preprint arXiv:2506.19315},
year = {2025}
}
备注
Accepted to the ISCA SLaTE-2025 Workshop