中文

关于习语数据集的综述:面向心理语言学与计算语言学研究

计算与语言 2025-08-19 v1

摘要

习语是具有比喻意义的表达方式,其含义往往无法从各个单词中推断出来,这使得其在计算上处理困难,并为人类实验研究带来挑战。本综述回顾了心理语言学和计算语言学领域开发的数据集,聚焦其内容、形式及其旨intended use。心理语言学资源通常包含沿熟悉度、透明度和组成性等维度的规范化评级,而计算数据集支持习语性检测/分类、改写和跨语言建模等任务。我们呈现了53个数据集的注释实践、覆盖范围和任务框架趋势。尽管近期努力扩大了语言覆盖范围和任务多样性,但心理语言学和计算语言学在习语研究方面似乎尚未形成关联。

关键词

引用

@article{arxiv.2508.11828,
  title  = {A Survey of Idiom Datasets for Psycholinguistic and Computational Research},
  author = {Michael Flor and Xinyi Liu and Anna Feldman},
  journal= {arXiv preprint arXiv:2508.11828},
  year   = {2025}
}

备注

KONVENS 2025. To appear