中文

面向视频推荐的用户满意度问卷端到端对齐

信息检索 2026-01-29 v1

摘要

短视频推荐系统通常使用稠密用户行为信号(如点击和观看时长)来优化排序模型,但这些信号仅是用户满意度的间接代理,常受噪声和偏置影响。近期,借助问卷收集的显式满意度反馈日益成为高质量的直接对齐监督,但其稀疏性且易被海量行为数据所淹没,难以纳入在线推荐模型。为此,我们提出一种新框架,即通过问卷实现用户满意度端到端对齐,命名为 EASQ,以实现排序模型与真实用户满意度的实时对齐。具体而言,我们首先通过结合多任务架构和轻量级 LoRA 模块构建稀疏问卷信号的独立参数通道。多任务设计将稀疏满意度监督从稠密行为信号中分离,防止前者被淹没;LoRA 模块以参数隔离方式预注入这些偏好,确保在优化用户满意度时保持主干网络的稳定性。此外,我们采用针对在线学习的 DPO 优化目标,使主模型输出在实时上与稀疏满意度信号对齐。该设计实现了端到端在线学习,使模型能够持续适应新的问卷反馈,同时保持主干的稳定性和有效性。大量离线实验和大规模在线 A/B 测试表明,EASQ 在多种场景下均显著提升用户满意度指标。EASQ 已成功部署于生产级短视频推荐系统,实现显著且稳定的业务增益。

关键词

引用

@article{arxiv.2601.20215,
  title  = {Towards End-to-End Alignment of User Satisfaction via Questionnaire in Video Recommendation},
  author = {Na Li and Jiaqi Yu and Minzhi Xie and Tiantian He and Xiaoxiao Xu and Zixiu Wang and Lantao Hu and Yongqi Liu and Han Li and Kaiqiao Zhan and Kun Gai},
  journal= {arXiv preprint arXiv:2601.20215},
  year   = {2026}
}