子词池化策略对跨语言事件检测的影响
计算与语言
2023-02-24 v2 机器学习
摘要
预训练多语言语言模型(如mBERT、XLM-RoBERTa)已显著推进零样本跨语言信息抽取的先进水平。这些语言模型普遍依赖将词拆分为更小组成子词的分词技术。因此,所有词标注任务(如命名实体识别、事件检测等)都需要一种池化策略,以子词表示为输入并输出整个词的表示。以跨语言事件检测任务为动机示例,我们表明池化策略的选择会对目标语言性能产生显著影响。例如,在ACE任务上以英语训练、阿拉伯语测试时,根据池化策略不同,性能相差高达16个绝对点。我们使用五种不同池化策略在九个语言的多语言多样数据集上开展分析。在各配置下,我们发现仅取首个子词表示整个词的经典策略通常次优。另一方面,我们展示注意力池化(attention pooling)对语言与数据集变化具有鲁棒性,表现为最佳或接近最优策略。为可复现,我们在https://github.com/isi-boston/ed-pooling提供代码。
引用
@article{arxiv.2302.11365,
title = {Impact of Subword Pooling Strategy on Cross-lingual Event Detection},
author = {Shantanu Agarwal and Steven Fincke and Chris Jenkins and Scott Miller and Elizabeth Boschee},
journal= {arXiv preprint arXiv:2302.11365},
year = {2023}
}