中文

通过对齐基模型协作优化多样性与质量

计算与语言 2025-11-11 v1 人工智能 机器学习

摘要

对齐技术极大提升了大语言模型(LLM)的输出质量,却以牺牲多样性为代价,导致各次生成间高度相似。我们提出对齐基模型协作(BACo),一种推理时词元级模型协作框架,通过动态结合基座 LLM 及其对齐模型来优化多样性与质量。受先前工作(Fei et al., 2025)启发,BACo 采用路由策略,基于下一词元预测的不确定性及预测内容的语义角色,在每个词元处决定从哪个模型解码。先前的促进多样性方法,如重训练、提示工程和多样本采样方法,虽能提升多样性,但常降低质量或需高昂的解码或后训练成本。相比之下,BACo 在单次过程中即可事后同时实现高多样性与高质量,并提供强可控性。我们探索了一族路由策略,在三个开放式生成任务及涵盖多样性与质量的 13 项指标上,BACo 始终超越最先进的推理时基线。采用最佳路由器时,BACo 在多样性与质量上实现了 21.3% 的联合提升。人工评估也反映了这些改进。结果表明,基座模型与对齐模型间的协作可优化并控制多样性与质量。

关键词

引用

@article{arxiv.2511.05650,
  title  = {Optimizing Diversity and Quality through Base-Aligned Model Collaboration},
  author = {Yichen Wang and Chenghao Yang and Tenghao Huang and Muhao Chen and Jonathan May and Mina Lee},
  journal= {arXiv preprint arXiv:2511.05650},
  year   = {2025}
}

备注

52 pages, 16 figures