中文

CPopQA:基于 LLM 对文化概念流行度排序

计算与语言 2023-11-15 v1

摘要

先前的工作已证明大语言模型(LLMs)能够辨别其预训练语料库中的统计倾向。尽管如此,许多关于 LLM 知识能力的考察聚焦于显式出现在训练数据中的知识或可从相似上下文隐式推断的知识。LLM 在推理中对概念(尤其是长尾概念)的语料库级统计趋势的捕捉程度仍未被充分探索。在本研究中,我们引入了一种新颖的少样本问答任务(CPopQA),用于考察 LLM 对长尾文化概念(例如节日)的统计排序能力,特别关注这些概念分别在美国和英国的流行度。我们策划了一个包含 58 个国家 459 个节日的数据集,生成了总计 6,000 个问答测试对。在四个强 LLM 上的实验表明,大模型能够针对长尾文化概念的统计倾向进行排序。值得注意的是,GPT-3.5 表现出优越性能,并展现出识别跨大陆地理文化邻近性的潜力。

关键词

引用

@article{arxiv.2311.07897,
  title  = {CPopQA: Ranking Cultural Concept Popularity by LLMs},
  author = {Ming Jiang and Mansi Joshi},
  journal= {arXiv preprint arXiv:2311.07897},
  year   = {2023}
}