PersonaDual:通过自适应推理平衡个性化与客观性
人工智能
2026-05-19 v3
摘要
随着用户越来越期望 LLM 符合其偏好,个性化信息变得很有价值。然而,个性化信息可能是一把双刃剑:它可以改善交互,但可能会损害客观性和事实正确性,特别是当它与问题不一致时。为了缓解这个问题,我们提出了 PersonaDual,这是一个在单一模型中同时支持通用客观推理和个性化推理,并根据上下文自适应切换模式的框架。PersonaDual 首先通过 SFT 进行训练以学习两种推理模式,然后通过我们提出的 DualGRPO 强化学习进一步优化以改善模式选择。在客观和个性化基准上的实验表明,PersonaDual 在保留个性化优势的同时减少了干扰,实现了近乎无干扰的性能,并更好地利用有用的个性化信号来改善客观问题求解。
引用
@article{arxiv.2601.08679,
title = {PersonaDual: Balancing Personalization and Objectivity via Adaptive Reasoning},
author = {Xiaoyou Liu and Xinyi Mou and Shengbin Yue and Liang Wang and Yuqing Wang and Qiexiang Wang and Tianrui Qin and Zhongyu Wei},
journal= {arXiv preprint arXiv:2601.08679},
year = {2026}
}