Machine Learning · Computer Science
Robust Preference Optimization through Reward Model Distillation
Adam Fisch, Jacob Eisenstein, Vicky Zayats, Alekh Agarwal +4
2025-03-04
Computation and Language · Computer Science
Combining On-Policy Optimization and Distillation for Long-Context Reasoning in Large Language Models
Miguel Moura Ramos, Duarte M. Alves, André F. T. Martins
2026-05-13
Artificial Intelligence · Computer Science
KEPO: Knowledge-Enhanced Preference Optimization for Multimodal Reasoning with Applications to Medical VQA
Fan Yang, Rui Meng, Trudi Di Qi, Ali Ezzati +1
2026-05-13
Machine Learning · Computer Science
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
Yuqian Fu, Haohuan Huang, Kaiwen Jiang, Jiacai Liu +3
2026-04-28
Computer Vision and Pattern Recognition · Computer Science
Diffusion Distillation With Direct Preference Optimization For Efficient 3D LiDAR Scene Completion
An Zhao, Shengyuan Zhang, Ling Yang, Zejian Li +5
2025-04-17
Machine Learning · Computer Science
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
Wenkai Yang, Weijie Liu, Ruobing Xie, Kai Yang +2
2026-02-27
Machine Learning · Computer Science
Teacher-Guided Policy Optimization for On-Policy Reasoning Distillation under Large Policy Divergence
Xinyu Liu, Kechen Jiao, Chunyang Xiao, Runsong Zhao +9
2026-05-29
Computer Vision and Pattern Recognition · Computer Science
MST-Distill: Mixture of Specialized Teachers for Cross-Modal Knowledge Distillation
Hui Li, Pengfei Yang, Juanyang Chen, Le Dong +2
2025-07-10
Machine Learning · Computer Science
Rubric-based On-policy Distillation
Junfeng Fang, Zhepei Hong, Mao Zheng, Mingyang Song +6
2026-05-11
Machine Learning · Computer Science
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
Siyan Zhao, Zhihui Xie, Mengchen Liu, Jing Huang +3
2026-03-23
Machine Learning · Computer Science
Fast and Effective On-policy Distillation from Reasoning Prefixes
Dongxu Zhang, Zhichao Yang, Sepehr Janghorbani, Jun Han +5
2026-02-18
Machine Learning · Computer Science
To Distill or Decide? Understanding the Algorithmic Trade-off in Partially Observable Reinforcement Learning
Yuda Song, Dhruv Rohatgi, Aarti Singh, J. Andrew Bagnell
2025-10-06
Machine Learning · Computer Science
Distilling Policy Distillation
Wojciech Marian Czarnecki, Razvan Pascanu, Simon Osindero, Siddhant M. Jayakumar +2
2019-02-07
Computer Vision and Pattern Recognition · Computer Science
Cross-Architecture Distillation Made Simple with Redundancy Suppression
Weijia Zhang, Yuehao Liu, Wu Ran, Chao Ma
2025-07-30
Machine Learning · Computer Science
Online Policy Distillation with Decision-Attention
Xinqiang Yu, Chuanguang Yang, Chengqing Yu, Libo Huang +2
2024-06-11
Machine Learning · Computer Science
Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning
Zehao Liu, Yuanpu Cao, Jinghui Chen, Vasant G. Honavar
2026-05-28
Machine Learning · Computer Science
Multi-Rollout On-Policy Distillation via Peer Successes and Failures
Weichen Yu, Xiaomin Li, Yizhou Zhao, Xiaoze Liu +7
2026-05-14
Machine Learning · Computer Science
DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
Quanhao Li, Junqiu Yu, Kaixun Jiang, Yujie Wei +6
2026-05-15
Computer Vision and Pattern Recognition · Computer Science
On-Policy Distillation with Best-of-N Teacher Rollout Selection
Ke Zhang, Yunjie Tian, Dongdi Zhao, Yijiang Li +3
2026-05-14
Machine Learning · Computer Science
daDPO: Distribution-Aware DPO for Distilling Conversational Abilities
Zhengze Zhang, Shiqi Wang, Yiqun Shen, Simin Guo +4
2025-06-23