中文

TrackList:追溯开放大语言模型中头部与尾部知识的查询语言多样性

计算与语言 2025-12-01 v2

摘要

大语言模型(LLMs)已被证明能高效地为用户输入查询提供定义类型的答案。虽然对人类而言,给出各种类型的答案(例如示例和释义)是一项简单的任务,但LLM在提供定义类型查询以外的正确答案方面却存在困难。在本研究中,我们使用TrackList评估了这种性能下降,TrackList是一个细粒度的语言学和统计分析流程,旨在研究预训练数据对LLM回答多样化语言查询的影响。我们还引入了RefoMed-EN,这是一个包含6170个人工标注医学术语及其对应定义、命名、示例、解释或释义的英文数据集。我们研究了一个概念的高频(头部)或低频(尾部)是否会影响语言模型的性能。我们使用句法和语义相似度指标、统计相关性和嵌入来评估LLM输出的质量。结果表明,LLM在定义型问题上的任务性能最高,而在示例型问题上最低。此外,我们发现对于定义型问题,大语言模型更倾向于对流行和常见的知识进行释义,而对尾部和技术性知识(尤其是在专家文本中)则较少进行释义。

关键词

引用

@article{arxiv.2511.21006,
  title  = {TrackList: Tracing Back Query Linguistic Diversity for Head and Tail Knowledge in Open Large Language Models},
  author = {Ioana Buhnila and Aman Sinha and Mathieu Constant},
  journal= {arXiv preprint arXiv:2511.21006},
  year   = {2025}
}

备注

under review