中文

IROTE:通过上下文内自我反思优化激发大语言模型的人类特质

计算与语言 2025-12-01 v2 人工智能 计算机与社会

摘要

基于各种人类撰写的语料库训练,大型语言模型(LLM)已展示出通过提示反映特定人类特质(例如个性或价值观)的某种能力,这有利于个性化LLM和社会模拟等应用。然而,现有方法存在表面化激发问题:LLM只能被引导模仿浅层且不稳定的风格模式,无法像人类一样在各种任务中精确且一致地体现所需特质。为了解决这一挑战,我们提出了IROTE,一种新颖的上下文内方法,用于稳定且可转移的特质激发。借鉴心理学理论,即特质是通过与身份相关的反思形成的,我们的方法在提示中自动生成并优化文本自我反思,其中包含自我感知的经验,以刺激LLM的特质驱动行为。优化通过迭代最大化信息论目标来实现,该目标增强LLM行为与目标特质之间的联系,同时减少反思中的噪声冗余,无需任何微调,从而产生引人注目且紧凑的特质反思。在三个人类特质系统上的大量实验表明,单个IROTE生成的自我反思可以诱导LLM在超出简单问卷回答的各种下游任务中稳定地模仿目标特质,始终优于现有的强基线。

关键词

引用

@article{arxiv.2508.08719,
  title  = {IROTE: Human-like Traits Elicitation of Large Language Model via In-Context Self-Reflective Optimization},
  author = {Yuzhuo Bai and Shitong Duan and Muhua Huang and Jing Yao and Zhenghao Liu and Peng Zhang and Tun Lu and Xiaoyuan Yi and Maosong Sun and Xing Xie},
  journal= {arXiv preprint arXiv:2508.08719},
  year   = {2025}
}

备注

This paper is accepted by AAAI 2026