评估大语言模型中态度、观点和价值观的潜力与挑战
计算与语言
2024-10-04 v3
摘要
大语言模型(LLM)的最新进展引发了人们对验证和理解LLM可能捕捉和传达的类人认知行为特征的广泛兴趣。这些认知行为特征通常包括态度、观点和价值观(AOV)。然而,测量LLM中蕴含的AOV仍然不透明,不同的评估方法可能产生不同的结果。这导致人们对不同研究之间的关联性以及如何解读它们缺乏清晰的认识。本文旨在通过提供对近期关于LLM中AOV评估工作的全面概述来弥合这一差距。此外,我们调查了这些工作中评估流程不同阶段的相关方法。通过这样做,我们探讨了在理解模型、人机对齐以及社会科学下游应用方面的潜力和挑战。最后,我们提供了关于评估方法、模型增强和跨学科合作的实践见解,从而为评估LLM中AOV这一不断发展的领域做出贡献。
引用
@article{arxiv.2406.11096,
title = {The Potential and Challenges of Evaluating Attitudes, Opinions, and Values in Large Language Models},
author = {Bolei Ma and Xinpeng Wang and Tiancheng Hu and Anna-Carolina Haensch and Michael A. Hedderich and Barbara Plank and Frauke Kreuter},
journal= {arXiv preprint arXiv:2406.11096},
year = {2024}
}
备注
EMNLP 2024 Findings