中文

MoRoVoc:面向罗马尼亚语地区方言识别的大规模数据集

计算与语言 2025-09-23 v1

摘要

本文介绍MoRoVoc,目前面向分析罗马尼亚语地区方言变体的最大数据集。该数据集包含超过93小时的音频内容,涵盖88,192个音频样本,数据在罗马尼亚语和摩尔多华共和国的罗马尼亚语之间得到平衡。我们进一步提出了一种用于语音模型的多目标对抗训练框架,将人口统计属性(即说话者的年龄和性别)作为对抗目标纳入其中,使模型在主要任务中具有判别能力,而对次要属性保持不变。对抗系数通过元学习动态调整,以优化性能。我们的 approach 取得了显著的提升:Wav2Vec2-Base在使用性别作为对抗目标时,实现了78.21%的罗马尼亚语方言识别准确率;而Wav2Vec2-Large在同时采用方言和年龄作为对抗目标时,实现了93.08%的性别分类准确率。

关键词

引用

@article{arxiv.2509.16781,
  title  = {MoRoVoc: A Large Dataset for Geographical Variation Identification of the Spoken Romanian Language},
  author = {Andrei-Marius Avram and Ema-Ioana Bănescu and Anda-Teodora Robea and Dumitru-Clementin Cercel and Mihaela-Claudia Cercel},
  journal= {arXiv preprint arXiv:2509.16781},
  year   = {2025}
}

备注

Accepted at EMNLP Findings 2025