中文

移动众包 LLM 微调的真实在线偏好聚合

机器学习 2026-05-26 v1 人工智能

摘要

为更好地满足移动应用(如导航)的用户需求,移动众包平台可通过收集来自众包工作者(如移动用户)的在线偏好反馈(如 AI 生成的交通状况预测),迭代对大型语言模型(LLM)生成内容进行校准。然而,工作者可能出于最大化其影响力或报酬而策略性地误报其在线偏好反馈。现有的移动众包管道(如基于 EM 的权重估计)无法识别此在线环境中最准确的工作者,导致在 T 个时间槽内产生线性 regret O(T)\mathcal{O}(T)。本文研究移动众包中 LLM 微调的真实在线偏好聚合。我们构建了一个新的动态贝叶斯游戏,以建模平台与战略移动工作者之间的时间序列多智能体学习过程。我们提出了一种新型在线加权聚合机制,动态调整每个工作者在偏好聚合中的权重,依据其反馈准确性。我们证明了该机制确保战略工作者提供真实反馈,并在 T 个时间槽内实现亚线性 regret O(T)\mathcal{O}(\sqrt{T})。我们进一步扩展了该机制以应对每个时间槽中工作者反馈有限的挑战场景,仍能保证亚线性 regret O(T)\mathcal{O}(\sqrt{T})。在使用真实世界数据集进行 LLM 微调实验中,我们进一步表明本机制在基准方案之上显著提升了性能。

关键词

引用

@article{arxiv.2605.24052,
  title  = {Truthful Online Preference Aggregation for LLM Fine-Tuning in Mobile Crowdsourcing},
  author = {Shugang Hao and Lingjie Duan},
  journal= {arXiv preprint arXiv:2605.24052},
  year   = {2026}
}