多样性无单一最优模型:学习用于样本多样性的路由器
计算与语言
2026-04-13 v2
摘要
当面对允许大量有效答案的提示时,全面生成这些答案是满足广泛用户需求的第一步。在本文中,我们研究了引出全面有效响应集的方法。为评估这一点,我们引入了\textbf{多样性覆盖率}(diversity coverage)这一指标,它衡量预测答案集中每个\textbf{唯一}答案相对于具有相同答案数量的最优答案集所获得的总质量分数。使用该指标,我们评估了18个LLM,发现没有任何单一模型能在生成多样化的开放式提示响应方面占据主导地位。然而,对于每个提示,都存在一个模型在生成多样化答案集方面显著优于所有其他模型。基于这一发现,我们引入了一个路由器,用于预测每个查询的最佳模型。在NB-Wildchat上,我们训练的路由器优于单一最佳模型基线(26.3%对比$23.8%)。我们进一步展示了在域外数据集(NB-Curated)以及不同答案生成提示策略上的泛化能力。我们的工作为在拥有模型套件时研究生成全面答案奠定了基础。
引用
@article{arxiv.2604.02319,
title = {No Single Best Model for Diversity: Learning a Router for Sample Diversity},
author = {Yuhan Liu and Fangyuan Xu and Vishakh Padmakumar and Daphne Ippolito and Eunsol Choi},
journal= {arXiv preprint arXiv:2604.02319},
year = {2026}
}
备注
under review