中文

GEM:基于生成熵引导的少样本 LLM 对齐偏好建模

系统与控制 2026-05-01 v2 系统与控制

摘要

大型语言模型(LLM)的对齐通常依赖监督奖励模型或外部评判器,这些方法需要大量标注。在医学、法律等专业领域,这类大规模偏好标注往往难以实现。为此,我们提出一种名为 GEM 的生成熵引导的偏好建模方法,用于 LLM 在低资源和领域特定情景下的对齐。我们不通过偏好数据训练判别性奖励模型,而是直接训练 LLM 以内化一个从能从人类偏好中提取和利用潜在的多维细粒度认知信号的闭环优化架构。具体而言,我们的认知过滤模块(Cognitive Filtering module)基于决策中的熵理论,首先利用链式思维(Chain-of-Thought, CoT)提示生成多样的候选推理链(CoTs)。随后,引入令牌评分机制对采样的 CoTs 进行排序和加权,从而提升高置信度答案的重要性,同时策略性地放大高熵令牌的权重。在这些被过滤后的偏好基础上,我们使用一种新颖的自评估群体优势算法(SEGA)进行微调,有效地聚合群体级认知信号,并将基于熵的评分转化为策略优化的隐式奖励。如此,GEM 使 LLM 能够依赖自身判断,建立一个基于熵引导的闭环认知优化框架,实现 LLM 的高效少样本对齐。在一般基准和领域特定任务(如数学推理和医学对话)上的实验表明,GEM 在少量偏好数据下即可显著提升性能。

关键词

引用

@article{arxiv.2511.13006,
  title  = {Cooperative ISAC for LAE: Joint Trajectory Planning, Power allocation, and Dynamic Time Division},
  author = {Fangzhi Li and Zhichu Ren and Cunhua Pan and Hong Ren and Jing Jin and Qixing Wang and Jiangzhou Wang},
  journal= {arXiv preprint arXiv:2511.13006},
  year   = {2026}
}