偏好学习中的主动查询合成
机器学习
2026-05-26 v1
摘要
高效学习用户偏好对于许多现代决策系统至关重要,但通常需要高成本的标注数据。主动学习可降低此成本,但标准方法因基于池子的评估而计算昂贵。进一步地,大多数方法假设所有查询反馈都同样可靠,忽略了 nearly identical 或 完全不相似项目之间的两两查询会产生模糊、低置信度响应。为解决反馈可靠性问题,我们引入一种新型 confidence aware response model,显式地考虑这些模糊比较。为克服基于池子的评估计算瓶颈,我们提出一种主动查询合成框架 Info-Synth,通过最大化基于互信息的目标在连续空间中生成最优查询。此外,我们提出两种策略 Pair M-dist 和 Pair Opt-dist,将 Info-Synth 扩展到有限查询池中选择有效查询。我们在合成偏好学习、受限文本摘要数据集以及针对模拟移动机器人连续空间控制增益的主观调参任务中展示了框架的通用性和性能。
引用
@article{arxiv.2605.26072,
title = {Active Query Synthesis for Preference Learning},
author = {Namrata Nadagouda and Nauman Ahad and Maegan Tucker and Mark A. Davenport},
journal= {arXiv preprint arXiv:2605.26072},
year = {2026}
}
备注
27 pages, 12 figures