中文

提升并评估大语言模型对在线社区对齐的忠实度

计算与语言 2025-02-12 v2 计算机与社会 社会与信息网络

摘要

大语言模型(LLM)在表征个体和社区方面展现出潜力,为研究复杂的社会动态提供了新途径。然而,将 LLM 有效对齐到特定人类群体并系统评估对齐的忠实度仍然是一个挑战。本文提出了一种通过指令微调将 LLM 与在线社区对齐的鲁棒框架,并在语言的各种方面(包括真实性、情感语调、毒性和伤害)全面评估对齐效果。我们将该方法应用于以饮食和身体形象为中心的在线社区,展示其效用。我们对对齐后的 LLM 实施饮食失调心理测量测试,揭示不健康的信念,并成功区分具有不同程度饮食失调风险的社区。我们的结果突显了 LLM 在自动审核以及公共卫生和社会科学研究更广泛应用中的潜力。

关键词

引用

@article{arxiv.2408.09366,
  title  = {Improving and Assessing the Fidelity of Large Language Models Alignment to Online Communities},
  author = {Minh Duc Chu and Zihao He and Rebecca Dorn and Kristina Lerman},
  journal= {arXiv preprint arXiv:2408.09366},
  year   = {2025}
}