面向对话式匈牙利语语音识别:引入 BEA-Large 与 BEA-Dialogue 数据集
计算与语言
2026-01-15 v2 人工智能
声音
音频与语音处理
摘要
自动语音识别(ASR)的发展主要得益于高资源语言中大规模数据集的积累,而诸如匈牙利语等语言因缺乏自然对话语料而处于数据稀缺状态。为填补这一空白,我们引入两个新数据集——BEA-Large 与 BEA-Dialogue——由前未加工处理的匈牙利语语料库 BEA 的部分内容构成。BEA-Large 在 BEA-Base 基础上扩展,包含 255 小时的自发语音,来自 433 名说话人,并附带细粒度分段元数据。BEA-Dialogue 包含 85 小时的自发对话,为匈牙利语对话语料库,包含独立于说话人的自然对话,支持对话式语音识别和说话人分割等研究。我们使用公开的 ASR 模型在这些数据集上建立可复现的基线,通过对 Fast Conformer 模型微调,分别在自发语音和重复语音上实现了最低 14.18% 和 4.8% 的词错误率。说话人分割实验得到的分割错误率介于 12.46% 与 17.40% 之间,为后续改进提供了参考基准。结果凸显了对话式语音识别的持久难度,尤其是由于停顔、语音重叠以及非正式语言模式的存在。通过发布这些数据集和基线,我们旨在推动匈牙利语语音技术的发展,并为在其他语言中构建自发和对话式基准提供方法论框架。
引用
@article{arxiv.2511.13529,
title = {Toward Conversational Hungarian Speech Recognition: Introducing the BEA-Large and BEA-Dialogue Datasets},
author = {Máté Gedeon and Piroska Zsófia Barta and Péter Mihajlik and Tekla Etelka Gráczi and Anna Kohári and Katalin Mády},
journal= {arXiv preprint arXiv:2511.13529},
year = {2026}
}
备注
Submitted to LREC 2026