中文

PiC:一个用于短语理解与语义搜索的上下文短语数据集

计算与语言 2023-02-03 v5 人工智能

摘要

尽管上下文词嵌入已成为事实上的标准,上下文短语嵌入的学习却较少被探索,并且受到缺乏人工标注基准的阻碍——该基准用于测试机器在给定上下文句子或段落(而非仅短语本身)时对短语语义的理解。为填补这一空白,我们提出PiC——一个包含约28K个名词短语及其对应维基百科上下文页面的数据集,以及一套用于训练和评估短语嵌入的三个任务。在PiC上训练可提升排序模型的准确率,并显著将跨度选择(SS)模型(即预测目标短语的起止索引)推至接近人类的准确率,在给定查询短语和段落的语义搜索上达到95%精确匹配(EM)。有趣的是,我们发现证据表明,这种令人印象深刻的性能是因为SS模型学会了更好地捕捉短语的通用含义,而不受其实际上下文影响。SOTA模型在区分同一短语在两种上下文中的两个义项(约60% EM)以及估计同一上下文中两个不同短语的相似度(约70% EM)方面表现不佳。

关键词

引用

@article{arxiv.2207.09068,
  title  = {PiC: A Phrase-in-Context Dataset for Phrase Understanding and Semantic Search},
  author = {Thang M. Pham and Seunghyun Yoon and Trung Bui and Anh Nguyen},
  journal= {arXiv preprint arXiv:2207.09068},
  year   = {2023}
}

备注

Accepted to EACL 2023