SMARTCAL:一种自我感知的工具使用评估与校准方法
机器学习
2024-12-18 v1 人工智能
软件工程
摘要
大型语言模型 (LLM) 的工具使用能力对广泛的工业应用产生了深远影响。然而,LLM 在合理使用工具方面的自我控制与校准能力仍有待深入研究。该问题后果严重,因为它增加了性能下降的潜在风险,并对模型的可信度构成威胁。在本文中,我们在三个数据集上使用两种主流工具使用框架,对一系列 SOTA LLM 进行了研究。我们的研究揭示了 LLM 的工具滥用行为,即模型倾向于以过度自信的态度误用工具。我们还发现,无论模型能力如何,这都是一个普遍问题。为此,我们提出了一种新颖的方法 \textit{SMARTCAL} 来缓解所观察到的问题,结果表明,与基线模型相比,QA 性能平均提升了 8.6%,预期校准误差 (ECE) 降低了 21.6%。
引用
@article{arxiv.2412.12151,
title = {SMARTCAL: An Approach to Self-Aware Tool-Use Evaluation and Calibration},
author = {Yuanhao Shen and Xiaodan Zhu and Lei Chen},
journal= {arXiv preprint arXiv:2412.12151},
year = {2024}
}