中文

基于AI的标注流水线用于大语言模型稳定化:人机协同方法

人工智能 2025-12-17 v1

摘要

LLM在高度受监管的行业中的实施因不稳定问题、不一致的推理、幻觉和性能变异而失败,尤其是在工作流中。这些可靠性问题限制了LLM在需要事实精确性和一致行为的领域中的安全使用(Aiyappa et al., 2023)。当前的稳定化方法,如基于人类反馈的强化学习(RLHF)和监督微调,提供了可量化的改进,但成本高昂且依赖于密集的人工标注,因此不易以可持续的方式进行扩展(Dong et al., 2023; Retzlaff et al., 2024)。本文提出了一种基于AI的标注流水线,系统地识别、标注和修复LLM输出中的不稳定模式。我们的人机协同方法结合了自动弱监督和基于置信度的标注模型与目标人工验证,以保证反馈信息的可靠性和道德正确性(Cabitza et al., 2023; Jiang et al., 2023)。稳定性专用标注的语义一致性、事实正确性和逻辑连贯性类别被引入我们的框架中,允许基于反馈循环对模型进行持续校准和鲁棒性增强(Honovich et al., 2021; Nan et al., 2021)。

关键词

引用

@article{arxiv.2512.13714,
  title  = {AI-Powered Annotation Pipelines for Stabilizing Large Language Models: A Human-AI Synergy Approach},
  author = {Gangesh Pathak and Prasanna Kumar},
  journal= {arXiv preprint arXiv:2512.13714},
  year   = {2025}
}

备注

16 Pages