基于元认知行为调谐的大语言模型多跳问答
人工智能
2026-05-12 v2
摘要
大型语言模型(LLM)在进行多跳问答时,尽管推理轨迹中已包含正确的中间结论,却常常会产生错误答案。我们认为,这一差距源于自我调控能力不足,而非推理容量不足。缺乏明确的调控机制,有效的中间结论会被进一步的探索所覆盖,或未被识别为逻辑上足够的条件。我们提出了元认知行为调谐(Metacognitive Behavioral Tuning, MBT),这是一种后训练框架,旨在推导推理轨迹中植入五阶段的元认知结构。五个阶段分别为:理解与过滤、计划、执行与监控、自我纠错和验证。MBT包含两种表述形式。MBT-S从头开始合成新的元认知轨迹,而MBT-R则将学生自身的轨迹改写为元认知形式。在HotpotQA、MuSiQue和2WikiMultiHopQA数据集上,MBT在不同模型规模下均取得了最高的准确率-效率得分(AES)。MBT在提升任务准确率的同时,保持了较短且稳定的轨迹,在MuSiQue数据集上的平均响应长度为基线方法的十倍之一,退化次数也显著降低。与控制组实验进一步确认,性能提升来源于五阶段结构先验本身。为定性评估推理轨迹的调控行为,我们引入了两个新指标:到达-冗余剖面(Reach-Redundancy Profile, RRP)和长度感知的元认知质量指数(length-aware Metacognitive Quality Index, MQI)。RRP捕捉答案到达的时间以及轨迹的冗余程度,MQI则量化了五个阶段在轨迹中的丰富程度。在两个指标下,MBT在不同模型规模下实现了最早的答案到达、最低的冗余率以及最丰富的阶段级行为。
引用
@article{arxiv.2602.22508,
title = {Metacognitive Behavioral Tuning of Large Language Models for Multi-Hop Question Answering},
author = {Ik-hwan Kim and Hyeongrok Han and Mingi Jung and Sangwon Yu and Jinseok Hong and Sang Hun Kim and Yoonyoung Choi and Sungroh Yoon},
journal= {arXiv preprint arXiv:2602.22508},
year = {2026}
}
备注
41 pages