T$^2$:面向情境问答的自适应测试时扩展策略
计算与语言
2025-06-05 v2
摘要
近期大语言模型(LLM)的进展在情境问答(Contextual Question Answering, CQA)中展现出惊人性能。然而,先前的方法通常会对问题复杂度不加区分地采用复杂的推理策略,导致适应性差。近期的高效测试时扩展方法引入预算约束或早停机制,以避免为简单问题“过度思考”,但这些方法会引入人类偏见,且未能充分发挥模型内在的推理能力。为此,我们提出了 T^2^2^2$ 不仅在准确率上超越基线方法,还通过最高可达 25.2% 的降低来减少计算开销。
关键词
引用
@article{arxiv.2505.17427,
title = {T$^2$: An Adaptive Test-Time Scaling Strategy for Contextual Question Answering},
author = {Zhengyi Zhao and Shubo Zhang and Zezhong Wang and Huimin Wang and Yutian Zhao and Bin Liang and Yefeng Zheng and Binyang Li and Kam-Fai Wong and Xian Wu},
journal= {arXiv preprint arXiv:2505.17427},
year = {2025}
}
备注
arXiv admin note: substantial text overlap with arXiv:2503.22985