C-Mining:通过几何错位无监督发现文化数据合成种子
计算与语言
2026-04-20 v1
摘要
在大语言模型(LLM)中实现文化对齐越来越依赖于合成数据生成。对于此类合成,最关键的初始步骤是种子筛选;然而,当前方法缺乏选择这些种子的可量化标准。现有方法依赖于不可扩展的人工筛选或易产生偏差的 LLM 提取,将文化特异性视为一个抽象概念而非可测量的信号。本文通过提出 C-Mining 来解决这一“量化差距”,这是一个无监督框架,将文化种子的发现从主观选择过程转化为可计算的数据挖掘形式化表述。我们的方法利用了一种新颖的几何洞察,即利用预训练嵌入空间中文化概念的跨语言错位作为可量化的发现信号。通过系统地识别这些以显著的语言排他性和几何隔离为特征的区域,同时主动过滤噪声,C-Mining 自动从原始多语言语料库中提取高保真文化点(CP),无需依赖人工或 LLM 监督,将准备成本降低了 150 倍以上。我们进一步利用挖掘到的知识来引导多样化指令微调数据集的合成。大量实验表明,这种以种子为中心的方法显著增强了文化理解和推理能力,在 CulturalBench-Hard 上取得了 +6.03 分的提升,并超越了最先进的基线,为高质量文化数据合成提供了一种可扩展、可量化的解决方案。
引用
@article{arxiv.2604.15675,
title = {C-Mining: Unsupervised Discovery of Seeds for Cultural Data Synthesis via Geometric Misalignment},
author = {Pufan Zeng and Yilun Liu and Mingchen Dai and Mengyao Piao and Chunguang Zhao and Lingqi Miao and Shimin Tao and Weibin Meng and Minggui He and Chenxin Liu and Zhenzhen Qin and Li Zhang and Hongxia Ma and Boxing Chen and Daimeng Wei},
journal= {arXiv preprint arXiv:2604.15675},
year = {2026}
}