多语言与多文化 figurative language 理解
计算与语言
2023-05-26 v1
摘要
比喻性语言在人类交流中无处不在,但在自然语言处理(NLP)中相对研究不足。已有英语数据集被创建以加速衡量和改进语言模型(LMs)处理比喻性语言的进展。然而,比喻性语言的使用是我们文化和社會经验的表达,使得这些短语难以普遍适用。在这项工作中,我们为七种具有多样文化的语言创建了一个比喻性语言推理数据集 \datasetname: Hindi、Indonesian、Javanese、Kannada、Sundanese、Swahili 和 Yoruba。我们的数据集显示,每种语言都依赖文化和区域概念进行比喻表达,同源语言之间的重叠最高。我们评估了多语言 LMs 在零样本和少样本设置下解释比喻性语言的能力。与英语相比,所有语言都表现出显著不足,性能差异反映了预训练和微调数据的可用性,强调了在训练期间让 LMs 接触更广泛的语言和文化变异的必要性。
引用
@article{arxiv.2305.16171,
title = {Multi-lingual and Multi-cultural Figurative Language Understanding},
author = {Anubha Kabra and Emmy Liu and Simran Khanuja and Alham Fikri Aji and Genta Indra Winata and Samuel Cahyawijaya and Anuoluwapo Aremu and Perez Ogayo and Graham Neubig},
journal= {arXiv preprint arXiv:2305.16171},
year = {2023}
}
备注
ACL 2023 Findings