跨语言学习与低资源微调:以土耳其语事实核查为例
计算与语言
2024-03-25 v2
摘要
错误信息通过社交媒体平台的快速传播引发了对其对公众舆论影响的担忧。虽然错误信息在其他语言中也很普遍,但该领域的大部分研究都集中在英语上。因此,包括土耳其语在内的其他语言的数据集十分匮乏。为了解决这个问题,我们引入了FCTR数据集,其中包含3238个真实世界的声明。该数据集涵盖多个领域,并整合了从三个土耳其事实核查组织收集的证据。此外,我们旨在评估跨语言迁移学习对低资源语言的有效性,特别关注土耳其语。我们在此背景下展示了大型语言模型的上下文学习(零样本和少样本)性能。实验结果表明,该数据集有潜力推动土耳其语的研究进展。
引用
@article{arxiv.2403.00411,
title = {Cross-Lingual Learning vs. Low-Resource Fine-Tuning: A Case Study with Fact-Checking in Turkish},
author = {Recep Firat Cekinel and Pinar Karagoz and Cagri Coltekin},
journal= {arXiv preprint arXiv:2403.00411},
year = {2024}
}
备注
LREC-COLING 2024