中文

将生成式人工智能与人类偏好对齐:面向在线评论管理的新型大语言模型微调方法

人工智能 2026-04-24 v1 计算与语言

摘要

在线评论在消费者决策过程中发挥着重要作用。已有研究强调了经理审查回复对客户关系管理和企业绩效的显著影响。然而,由于审查回复需要大量人力,大量在线评论仍未被 addressing。虽然生成式人工智能在诸多任务上取得了显著成功,但通用-purpose 模型可能不与特定领域的人类偏好良好对齐。为此,常用微调来将通用生成式人工智能模型针对特定领域应用进行定制。然而,针对特定领域数据进行微调仍面临诸多挑战,包括幻觉现象、难以表征领域特定人类偏好以及离线 policy 优化过于保守。为此,我们提出一种新颖的偏好微调方法,以将大语言模型与特定领域人类偏好对齐,用于生成在线评论回复。具体而言,我们首先识别幻觉的来源,提出有效的 context 增强方法以缓解大语言模型幻觉。为表征人类偏好,我们提出一种 theory-driven 偏好微调方法,自动构建在线评论领域的人类偏好配对。此外,我们提出一种 curriculum learning 方法进一步提升偏好微调。为克服现有离线偏好微调方法的过于保守挑战,我们提出一种基于密度估计的 support 约束方法以放宽保守性,并给出其优越理论保证的数学证明。广泛的评估结果 substantiate 我们所提出的偏好微调方法的优越性。

关键词

引用

@article{arxiv.2604.21209,
  title  = {Align Generative Artificial Intelligence with Human Preferences: A Novel Large Language Model Fine-Tuning Method for Online Review Management},
  author = {Yanan Wang and Yong Ge},
  journal= {arXiv preprint arXiv:2604.21209},
  year   = {2026}
}

备注

Accepted to Information Systems Research (ISR). This is a preliminary version