Hansel:一个中文少样本与零样本实体链接基准
计算与语言
2023-10-31 v2
摘要
现代实体链接(EL)系统固有一种流行度偏差,然而目前尚无聚焦于英语以外语言中长尾与新兴实体的数据集。我们提出 Hansel,一个填补非英语少样本与零样本 EL 挑战空白的中文新基准。Hansel 的测试集经人工标注与审阅,采用一种收集零样本 EL 数据集的新方法创建。其涵盖新闻、社交媒体帖子及其他网络文章中的 10K 篇多样化文档,以 Wikidata 作为目标知识库。我们证明现有最先进 EL 系统在 Hansel 上表现不佳(少样本下 R@1 为 36.6%)。随后我们建立一个强基线,在数据集上少样本取得 R@1 46.2%、零样本取得 76.6%。我们还展示该基线在 TAC-KBP2015 中文实体链接任务上取得了有竞争力的结果。
引用
@article{arxiv.2207.13005,
title = {Hansel: A Chinese Few-Shot and Zero-Shot Entity Linking Benchmark},
author = {Zhenran Xu and Zifei Shan and Yuxin Li and Baotian Hu and Bing Qin},
journal= {arXiv preprint arXiv:2207.13005},
year = {2023}
}
备注
WSDM 2023