名如其义:基于百万实体千万名称的语义问答评估
计算与语言
2022-03-01 v1
摘要
经典的基于词汇匹配的问答指标正逐渐被淘汰,因为它们仅因简洁或信息丰富的输出未作为标准答案提供而对其进行惩罚。近期提出的神经指标虽能评估语义相似度,但训练于从其他领域嫁接的小型文本相似度数据集。我们引入了 Wiki 实体相似度(WES)数据集,一个由维基百科链接文本生成、包含 1100 万例、面向领域、语义实体相似度数据集。WES 专为问答评估定制:示例为实体与短语,并分组为语义簇以模拟多个标准答案标签。人类标注者一致认同 WES 标签,且一个基础的交叉编码器指标在预测人类正确性判断上优于四种经典指标。
引用
@article{arxiv.2202.13581,
title = {'Tis but Thy Name: Semantic Question Answering Evaluation with 11M Names for 1M Entities},
author = {Albert Huang},
journal= {arXiv preprint arXiv:2202.13581},
year = {2022}
}
备注
4 pages, 2 figures. Will be updated with more analysis and baseline models