中文

T$^2$:面向情境问答的自适应测试时扩展策略

计算与语言 2025-06-05 v2

摘要

近期大语言模型(LLM)的进展在情境问答(Contextual Question Answering, CQA)中展现出惊人性能。然而,先前的方法通常会对问题复杂度不加区分地采用复杂的推理策略,导致适应性差。近期的高效测试时扩展方法引入预算约束或早停机制,以避免为简单问题“过度思考”,但这些方法会引入人类偏见,且未能充分发挥模型内在的推理能力。为此,我们提出了 T2ThinktoThink,一种新型框架,通过动态调整推理深度来适应问题复杂度。T^2:Think-to-Think,一种新型框架,通过动态调整推理深度来适应问题复杂度。T^2基于以下洞见:如果LLM能通过特定推理策略有效解决类似问题,就可以将同一策略应用于原问题。这一洞见使我们能够为简单问题采用简洁推理,同时为复杂问题保持细致分析。T 基于以下洞见:如果 LLM 能通过特定推理策略有效解决类似问题,就可以将同一策略应用于原问题。这一洞见使我们能够为简单问题采用简洁推理,同时为复杂问题保持细致分析。T^2通过四个关键步骤实现:将问题分解为结构元素、生成带有候选推理策略的类似示例、根据多个准则评估这些策略、并将最合适的策略应用于原问题。跨七个多样化CQA基准的实验表明,T 通过四个关键步骤实现:将问题分解为结构元素、生成带有候选推理策略的类似示例、根据多个准则评估这些策略、并将最合适的策略应用于原问题。跨七个多样化 CQA 基准的实验表明,T^2$ 不仅在准确率上超越基线方法,还通过最高可达 25.2% 的降低来减少计算开销。

关键词

引用

@article{arxiv.2505.17427,
  title  = {T$^2$: An Adaptive Test-Time Scaling Strategy for Contextual Question Answering},
  author = {Zhengyi Zhao and Shubo Zhang and Zezhong Wang and Huimin Wang and Yutian Zhao and Bin Liang and Yefeng Zheng and Binyang Li and Kam-Fai Wong and Xian Wu},
  journal= {arXiv preprint arXiv:2505.17427},
  year   = {2025}
}

备注

arXiv admin note: substantial text overlap with arXiv:2503.22985