中文

CORE:用于鲁棒域适应的少样本公司关系分类数据集

计算与语言 2023-10-19 v1

摘要

我们介绍 CORE,一个聚焦于公司关系与商业实体的少样本关系分类(RC)数据集。CORE 包含从公司维基百科页面提取的 12 种关系类型的 4,708 个带相应文本证据的实例。公司名称与商业实体因其关联信息的丰富性与多样性,对少样本 RC 模型构成挑战。例如,公司名称根据上下文可能代表法律实体、产品、人员或业务部门。因此,推导实体间关系类型高度依赖于文本上下文。为评估最先进 RC 模型在 CORE 数据集上的表现,我们在少样本域适应设定下开展实验。结果揭示了显著的性能差距,证实在不同域上训练的模型难以适应 CORE。有趣的是,我们发现于 CORE 上训练的模型展现出改进的分布外性能,这凸显了高质量数据对鲁棒域适应的重要性。具体而言,商业实体中嵌入的信息丰富性使模型能关注上下文细微差别,减少对关系特定动词等表面线索的依赖。除数据集外,我们提供相关代码片段以促进可复现性并鼓励该领域的进一步研究。

关键词

引用

@article{arxiv.2310.12024,
  title  = {CORE: A Few-Shot Company Relation Classification Dataset for Robust Domain Adaptation},
  author = {Philipp Borchert and Jochen De Weerdt and Kristof Coussement and Arno De Caigny and Marie-Francine Moens},
  journal= {arXiv preprint arXiv:2310.12024},
  year   = {2023}
}

备注

Accepted to EMNLP 2023 main conference