超越模态限制:面向自动说话评估的统一 MLLM 方法及有效课程学习
计算与语言
2025-08-19 v1 人工智能
声音
摘要
传统自动说话评估 (ASA) 系统存在固有的模态限制:基于文本的方法缺乏声学信息,而基于音频的方法则忽略语义语境。多模态大语言模型 (MLLM) 通过同时处理音频和文本,为综合性 ASA 提供了前所未有的机遇。本文进行了 MLLM 用于综合性 ASA 的首个系统性研究,展示了 MLLM 在内容和语言使用方面的优越性能。然而,对交付方面的评估揭示了独特挑战,被认为需要专门的训练策略。我们因此提出了 Speech-First Multimodal Training (SFMT),利用课程学习原则在跨模态协同融合之前建立更稳健的语音建模基础。一系列实验在基准数据集上显示,MLLM-based 系统将整体评估性能从 PCC 值 0.783 提升至 0.846。特别是,SFMT 在交付方面的评估中实现了准确率提升 4%,这也为 ASA 开辟了新的道路。
引用
@article{arxiv.2508.12591,
title = {Beyond Modality Limitations: A Unified MLLM Approach to Automated Speaking Assessment with Effective Curriculum Learning},
author = {Yu-Hsuan Fang and Tien-Hong Lo and Yao-Ting Sung and Berlin Chen},
journal= {arXiv preprint arXiv:2508.12591},
year = {2025}
}
备注
Accepted at IEEE ASRU 2025