基于价值编码本的大语言模型文化价值观对齐的分布式开放性评估
计算与语言
2026-04-10 v2 人工智能
计算机与社会
机器学习
摘要
随着LLM的全球部署,对其文化价值取向进行对齐对于安全性和用户参与度至关重要。然而,现有基准面临构建-组合-上下文()挑战:依赖判别性的多项选择格式来探测价值知识而非真正的价值取向,忽视亚文化异质性,并与现实世界的开放式生成不匹配。我们引入DOVE,一个分布式评估框架,直接比较人类书写的文本分布与LLM生成的输出。DOVE利用率失真变分优化目标,从10K个文档中构建一个紧凑的价值编码本,将文本映射到结构化的价值空间以过滤语义噪声。对齐程度使用不平衡最优传输进行度量,以捕捉文化内部分布结构和子群体多样性。在12个LLM上的实验表明,DOVE实现了优越的预测有效性,在与下游任务达到31.56%相关性的同时,仅需每种文化500个样本即可保持高可靠性。
引用
@article{arxiv.2604.06210,
title = {Distributional Open-Ended Evaluation of LLM Cultural Value Alignment Based on Value Codebook},
author = {Jaehyeok Lee and Xiaoyuan Yi and Jing Yao and Hyunjin Hwang and Roy Ka-Wei Lee and Xing Xie and JinYeong Bak},
journal= {arXiv preprint arXiv:2604.06210},
year = {2026}
}