面向 LLM 解码与对齐的记号化老虎机
机器学习
2025-06-10 v1 人工智能
摘要
我们提出了记号化线性老虎机 (TLB) 和记号化多臂老虎机 (TMAB),灵感来自 LLM 解码和对齐。 在这两种问题中,在轮次 中,用户提交查询 (上下文),决策者 (DM) 依据不可撤销地从记号集合中选择记号。一旦序列完成,DM 会观察来自用户的随机效用,其期望由将所选记号序列映射到依赖于查询的非负实数值的序列函数呈现。在两种问题中,我们首先指出,在序列函数无任何结构时学习是不可能的。我们提出一种自然假设——即通过更多公共实现距离递减 (DDMC),并提出算法,其悖论为 和 分别适用于 TLB 和 TMAB。作为副产品,我们获得了在 DDMC 下,贪心解码算法几乎的最优性,这解释了贪心解码在多个任务中的不合理有效性。这也立即适用于解码时间 LLM 对齐,当误差效用可表示为冻结 LLM 的效用和线性可实现潜在函数时。我们最终通过合成和真实世界数据集经验验证了算法性能,并验证了我们的假设。
引用
@article{arxiv.2506.07276,
title = {Tokenized Bandit for LLM Decoding and Alignment},
author = {Suho Shin and Chenghao Yang and Haifeng Xu and Mohammad T. Hajiaghayi},
journal= {arXiv preprint arXiv:2506.07276},
year = {2025}
}
备注
To appear at ICML 2025