CARD:基于奖励引导的聚类级适应用于个人化文本生成
人工智能
2026-04-28 v2
摘要
针对大语言模型的细粒度个人化与可扩展部署之间的矛盾,个人化仍然具有挑战性。我们提出CARD框架,实现分层的个人化,通过渐进式细化。CARD首先根据共享的风格模式对用户进行聚类,并学习聚类特定的LoRA适配器,实现鲁棒的泛化和强大的低资源性能。为了捕捉每个聚类内的个人差异,我们提出了一种隐式偏好学习机制,通过对比用户撰写的文本与聚类级别的生成,允许模型在没有手动标注的情况下推断用户特定的风格偏好。在推理时间,CARD通过轻量级用户偏好向量和低秩logit校正,在解码阶段注入个人化,而保持基础模型冻结。在LaMP和LongLaMP基准测试上实验显示,CARD在生成质量方面达到与最先进的基线相当或更好的性能,同时显著提高了效率和可扩展性,以实现实际的个人化文本生成。
引用
@article{arxiv.2601.06352,
title = {CARD: Cluster-level Adaptation with Reward-guided Decoding for Personalized Text Generation},
author = {Yutong Song and Jiang Wu and Weijia Zhang and Chengze Shen and Shaofan Yuan and Weitao Lu and Jian Wang and Yu Wang and Nikil Dutt and Amir M. Rahmani},
journal= {arXiv preprint arXiv:2601.06352},
year = {2026}
}