中文

面向在线人类行为的大语言模型对齐

计算与语言 2024-05-02 v1 人工智能

摘要

大语言模型对齐广泛用于避免 LLM 生成无帮助或有害的响应。然而,漫长的训练过程和预定义的偏好偏差阻碍了对在线多样化人类偏好的适应。为此,本文提出一种对齐框架,称为强化学习与人类行为 (RLHB),通过直接利用真实的在线人类行为来实现 LLM 对齐。该框架采用生成对抗网络结构,生成器训练以遵循预期的人类行为;而判别器则尝试验证查询、响应和人类行为的三元组是否来自真实的在线环境。自然语言形式的行为建模和多模型联合训练机制实现了主动且可持续的在线对齐。实验结果通过人类和自动评估均确认了所提出方法的有效性。

关键词

引用

@article{arxiv.2405.00578,
  title  = {The Real, the Better: Aligning Large Language Models with Online Human Behaviors},
  author = {Guanying Jiang and Lingyong Yan and Haibo Shi and Dawei Yin},
  journal= {arXiv preprint arXiv:2405.00578},
  year   = {2024}
}

备注

11 pages, 6 figures