MoRoVoc:面向罗马尼亚语地区方言识别的大规模数据集
计算与语言
2025-09-23 v1
摘要
本文介绍MoRoVoc,目前面向分析罗马尼亚语地区方言变体的最大数据集。该数据集包含超过93小时的音频内容,涵盖88,192个音频样本,数据在罗马尼亚语和摩尔多华共和国的罗马尼亚语之间得到平衡。我们进一步提出了一种用于语音模型的多目标对抗训练框架,将人口统计属性(即说话者的年龄和性别)作为对抗目标纳入其中,使模型在主要任务中具有判别能力,而对次要属性保持不变。对抗系数通过元学习动态调整,以优化性能。我们的 approach 取得了显著的提升:Wav2Vec2-Base在使用性别作为对抗目标时,实现了78.21%的罗马尼亚语方言识别准确率;而Wav2Vec2-Large在同时采用方言和年龄作为对抗目标时,实现了93.08%的性别分类准确率。
引用
@article{arxiv.2509.16781,
title = {MoRoVoc: A Large Dataset for Geographical Variation Identification of the Spoken Romanian Language},
author = {Andrei-Marius Avram and Ema-Ioana Bănescu and Anda-Teodora Robea and Dumitru-Clementin Cercel and Mihaela-Claudia Cercel},
journal= {arXiv preprint arXiv:2509.16781},
year = {2025}
}
备注
Accepted at EMNLP Findings 2025