中文

AlignSurvey:社会调查中人类偏好对齐的综合基准

计算与语言 2025-11-14 v2

摘要

通过社会调查理解人类的态度、偏好和行为对于学术研究和政策制定至关重要。然而,传统调查面临着持续存在的挑战,包括固定问题格式、高成本、有限的适应性以及难以确保跨文化等效性。虽然近期研究探索使用大型语言模型(LLM)来模拟调查响应,但大多数研究仅限于结构化问题,忽略了整个调查过程,并且由于训练数据偏差,存在代表性不足的边缘群体风险。我们引入了 AlignSurvey,这是第一个使用 LLM 系统性地复现和评估完整社会调查流程的基准。它定义了与关键调查阶段相对应的四个任务:社会角色建模、半结构化访谈建模、态度立场建模和调查响应建模。它还提供了特定任务的评估指标,以在个体和群体层面评估对齐保真度、一致性和公平性,重点关注人口多样性。为支持 AlignSurvey,我们构建了一个多层次数据集架构:(i) 社会基础语料库,一个包含 44K+ 访谈对话和 400K+ 结构化调查记录的跨国资源;(ii) 一套全流程调查数据集,包括专家标注的 AlignSurvey-Expert (ASE) 和两个用于跨文化评估的全国代表性调查。我们发布了 SurveyLM 系列模型,该系列通过对开源 LLM 进行两阶段微调获得,并为评估特定领域对齐提供了参考模型。所有数据集、模型和工具均可在 github 和 huggingface 上获取,以支持透明且对社会负责的研究。

关键词

引用

@article{arxiv.2511.07871,
  title  = {AlignSurvey: A Comprehensive Benchmark for Human Preferences Alignment in Social Surveys},
  author = {Chenxi Lin and Weikang Yuan and Zhuoren Jiang and Biao Huang and Ruitao Zhang and Jianan Ge and Yueqian Xu and Jianxing Yu},
  journal= {arXiv preprint arXiv:2511.07871},
  year   = {2025}
}