利用新的西班牙语语料库进行多语言与跨语言隐喻检测
计算与语言
2022-10-25 v2
摘要
除英语外,其他语言缺乏标注日常隐喻表达的广覆盖数据集的情况十分突出。这意味着大多数关于有监督隐喻检测的研究仅以该语言发表。为解决此问题,本工作提出了首个用西班牙语中自然出现的隐喻标注的语料库,其规模足以开发执行隐喻检测的系统。所呈现的数据集CoMeta包含来自多个领域的文本,即新闻、政治话语、维基百科和评论。为标注CoMeta,我们应用MIPVU方法,即最常用于在真实数据上系统标注隐喻的指南。我们使用新创建的数据集,通过微调多个最先进的多语言和单语大语言模型来提供有竞争力的基线。此外,通过利用现有的VUAM英语数据以及CoMeta,我们提出了据我们所知首个关于有监督隐喻检测的跨语言实验。最后,我们进行了详细的错误分析,探究了这两种语言和数据集之间日常隐喻看似很高的迁移性。
引用
@article{arxiv.2210.10358,
title = {Leveraging a New Spanish Corpus for Multilingual and Crosslingual Metaphor Detection},
author = {Elisa Sanchez-Bayona and Rodrigo Agerri},
journal= {arXiv preprint arXiv:2210.10358},
year = {2022}
}
备注
To be published in CoNLL 2022