CultureSynth:面向文化问答合成的分层分类学指导下的检索增强框架
计算与语言
2025-09-16 v1 人工智能
摘要
文化能力(定义为理解和适应多元文化环境的能力)正在成为全球环境下大型语言模型(LLMs)的关键能力。虽然已有多个文化基准用于评估 LLMs 的文化能力,但当前评估存在分类学碎片化、领域特定性强以及对手动数据标注过度依赖等问题。为此,我们引入 CultureSynth,一个新型框架,包含(1)覆盖 12 个主要主题和 130 个次要主题的综合性分层多语言文化分类学,以及(2)基于检索增强生成(RAG)的方法,利用事实知识合成与文化相关的问答对。CultureSynth-7 合成基准包含 19,360 条条目,以及 4,149 条经过手动验证的条目,覆盖 7 种语言。对 14 种主流不同规模的 LLMs 进行评估后,发现 ChatGPT-4o-Latest 和 Qwen2.5-72B-Instruct 等模型在性能上存在明显的层级划分。结果表明,3B 参数是实现基本文化能力的必要阈值,模型在知识加工中显示出不同的架构偏见,并且不同模型之间存在显著的地理分布差异。我们认为 CultureSynth 为开发具文化意识的 AI 系统提供了可扩展框架,同时减少对手动标注的依赖。
引用
@article{arxiv.2509.10886,
title = {CultureSynth: A Hierarchical Taxonomy-Guided and Retrieval-Augmented Framework for Cultural Question-Answer Synthesis},
author = {Xinyu Zhang and Pei Zhang and Shuang Luo and Jialong Tang and Yu Wan and Baosong Yang and Fei Huang},
journal= {arXiv preprint arXiv:2509.10886},
year = {2025}
}
备注
Accepted as a Findings paper at EMNLP 2025