面向自动说话评估的得分序性与非均匀区间建模有效策略
音频与语音处理
2025-09-23 v2 机器学习
声音
摘要
近年来,基于自监督学习 (SSL) 的自动说话评估 (ASA) 研究取得了显著进展,这些方法能捕获非母语者 speech 中的丰富声学和语言模式,无需人工特征 curated。然而,speech-based SSL 模型仅捕获声学相关特征,忽略语言内容;而 text-based SSL 模型依赖 ASR 输出,难以编码语音韵律细节。此外,大多数已有方法将熟练程度视为名义类别,忽略了其序数结构以及熟练程度标签之间非均匀区间。为此,我们提出一种有效的 ASA 方法,将 SSL 与手工指示特征结合,采用新颖的建模范式。我们进一步引入多边际序数损失,联合建模得分序性和熟练程度标签的非均匀区间。大量实验表明,我们的方法在 TEEMI 语料库上 consistently 优于强基准模型,并对未见提示词表现出良好泛化能力。
引用
@article{arxiv.2509.03372,
title = {An Effective Strategy for Modeling Score Ordinality and Non-uniform Intervals in Automated Speaking Assessment},
author = {Tien-Hong Lo and Szu-Yu Chen and Yao-Ting Sung and Berlin Chen},
journal= {arXiv preprint arXiv:2509.03372},
year = {2025}
}
备注
Accepted at ASRU 2025