个性化对齐重访:用户多样性的必要性与充分性
机器学习
2026-05-12 v1 人工智能
计算与语言
摘要
个性化对齐旨在适应大语言模型以响应异构用户偏好,但其统计效率的精确理论条件尚未正式建立。本文刻画了个性化对齐实现 O(1) 在线后悔和 log(1/epsilon) 离线样本复杂度的条件。我们证明,这些最优速率依赖于特定的用户多样性条件:用户特定头部的人口必须跨越能够改变最优响应的潜在奖励方向。我们证明,该条件是必要的也是充分的。当满足该条件时,简单的贪心算法即可实现基准效率;当该条件失败时,自然可接受类中的每个学习者都至少会产生对数后悔。我们的结果识别用户多样性作为个性化可识别性的根本驱动因素。
引用
@article{arxiv.2605.09119,
title = {Personalized Alignment Revisited: The Necessity and Sufficiency of User Diversity},
author = {Enoch Hyunwook Kang},
journal= {arXiv preprint arXiv:2605.09119},
year = {2026}
}