面向挪威语方言的HiTZ方案:通过语言迁移与自动数据标注克服数据稀缺问题
计算与语言
2025-01-10 v2 人工智能
机器学习
摘要
本文介绍了我们在2025年VarDial工作坊(Scherrer等,2025)上的NorSID共享任务提交方案,包括三个任务:意图检测、槽位填充和方言识别,使用不同挪威语方言的数据进行评估。对于意图检测和槽位填充,我们采用交叉语言设置对多任务模型进行微调,以利用可用于17种语言的xSID数据集。对于方言识别,我们的最终提交方案是基于提供的开发集微调的模型,实验结果显示该模型在各项指标上均取得了最高分。我们的最终测试集结果显示,模型的性能与开发集相当,可能是由于数据集的领域特定性以及两个子集分布的相似性。此外,我们还报告了对所提供数据集及其数据集偏差的深入分析,以及其他一些实验的结果——这些实验虽然没有取得最佳结果。我们还呈现了分析某些方法比其他方法更成功的原因;主要是语言组合和训练数据的领域特定性对结果的影响。
引用
@article{arxiv.2412.10095,
title = {HiTZ at VarDial 2025 NorSID: Overcoming Data Scarcity with Language Transfer and Automatic Data Annotation},
author = {Jaione Bengoetxea and Mikel Zubillaga and Ekhi Azurmendi and Maite Heredia and Julen Etxaniz and Markel Ferro and Jeremy Barnes},
journal= {arXiv preprint arXiv:2412.10095},
year = {2025}
}
备注
Vardial 2025 NorSID Shared Task, fixed minor typos