中文

语义投票:面向不可验证开放性任务的无自评高效LLM自我改进方法

计算与语言 2026-04-01 v2 人工智能

摘要

获取监督数据的高昂成本推动了大语言模型(LLM)自我改进的广泛关注。简单的人工监督信号如多数投票在生成可验证任务的伪标签方面已被证明有效,而其针对不可验证任务(如翻译)的适用性受限于响应的开放性。因此,通常采用自评估机制(如自判断和熵最小化)以派生伪标签。然而,依赖LLM的自评估通常造成高计算开销,并因内在偏见引入过度自信问题。为此,我们提出一种无自评估的方法,用于不可验证任务,旨在轻量且有效的自我改进。我们受可验证任务中常用的多数投票启发,提出语义投票作为一种新机制,通过放宽硬匹配(即精确匹配)原则 toward软匹配(即语义相似性),以实现软匹配。通过利用轻量级句子嵌入模型量化语义相似性,从而减轻过度的计算负担和自评估内在偏见关联限制。全面实验表明,我们的方法在计算效率和整体性能方面均优于自评估方法,跨越 diverse模型架构和任务。

关键词

引用

@article{arxiv.2509.23067,
  title  = {Semantic Voting: A Self-Evaluation-Free Approach for Efficient LLM Self-Improvement on Unverifiable Open-ended Tasks},
  author = {Chunyang Jiang and Yonggang Zhang and Yiyang Cai and Chi-Min Chan and Yulong Liu and Mingming Chen and Wei Xue and Yike Guo},
  journal= {arXiv preprint arXiv:2509.23067},
  year   = {2026}
}