通过纳什学习与自适应反馈实现语言对齐
机器学习
2024-06-25 v1 人工智能
计算与语言
计算机科学与博弈论
摘要
最近的研究表明,通过在 minimax 游戏设置中引入偏好模型的纳什学习(Nash Learning via Human Feedback)对于大语言模型对齐具有潜力。我们进一步将对齐问题形式化为一种镜像下降算法,针对来自改进对手的自适应反馈进行学习,从而无需学习偏好模型或存在标注数据集。我们称之为 Language Alignment via Nash-learning and Adaptive feedback(LANA)的 resulting 算法能够在不需要人类标注偏好数据集的情况下实现自我对齐。我们通过各种实验和数学讨论支持这一声明。
引用
@article{arxiv.2406.15890,
title = {Language Alignment via Nash-learning and Adaptive feedback},
author = {Ari Azarafrooz and Farshid Faal},
journal= {arXiv preprint arXiv:2406.15890},
year = {2024}
}
备注
Accepted at ICML 2024 Workshop on Models of Human Feedback for AI Alignment, Vienna, Austria