LLM 作为文化档案:文化常识知识图谱抽取
计算与语言
2026-01-27 v1
摘要
大型语言模型(LLM)编码了从多样化网络规模数据中学习的丰富文化知识,为大规模建模文化常识提供了前所未有的机遇。然而,这些知识大多保持隐式与非结构化,限制了其可解释性与可用性。我们提出了一个迭代的、基于提示的框架来构建文化常识知识图谱(CCKG),该框架将 LLM 视为文化档案,系统地引出特定文化的实体、关系与实践,并将其组合成跨语言的多步推理链。我们在五个国家上对 CCKG 进行了评估,采用人类对文化相关性、正确性与路径连贯性的判断。我们发现,文化知识图谱在英语中实现得更好,即使目标文化是非英语的(如中文、印尼语、阿拉伯语),这表明当前 LLM 中存在不均衡的文化编码。用 CCKG 增强较小的 LLM 可提升在文化推理与故事生成上的性能,其中英语链带来的增益最大。我们的结果展示了 LLM 作为文化技术的潜力与局限,并表明链式结构的文化知识是文化扎根 NLP 的实用基底。
引用
@article{arxiv.2601.17971,
title = {LLMs as Cultural Archives: Cultural Commonsense Knowledge Graph Extraction},
author = {Junior Cedric Tonga and Chen Cecilia Liu and Iryna Gurevych and Fajri Koto},
journal= {arXiv preprint arXiv:2601.17971},
year = {2026}
}
备注
EACL 2026 MAIN