通过有智能体的循环方法揭示语言模型的盲区
计算与语言
2024-11-05 v3
摘要
语言模型(LM)在各种任务中取得了令人瞩目的准确性,但仍然对高置信度的错误分类十分脆弱,这些错误也被称为未知未知(unknown unknowns, UUs)。这些UUs在特征空间中聚集成盲区,导致在高风险应用中存在重大风险。这尤其适用于较小、轻量级的语言模型,这些模型更容易受到此类错误的影响。虽然对UUs的识别已被广泛研究,但其缓解仍是一个开放性挑战,包括如何利用已识别的UUs来消除未出现的盲区。本文提出了一种新方法,通过利用智能体(即人类或大型语言模型)作为教师来刻画UUs类型错误,以解决盲区缓解问题。通过利用智能体的泛化能力,我们识别了高置信度误分类中的模式,并据此生成针对性的合成样本,以提高模型的鲁棒性并减少盲区。我们在三个分类任务上进行了广泛的评估,证明了该方法在降低UUs数量方面的有效性,同时保持了类似的准确率水平。我们发现,人类计算的有效性具有很高的上限,但高度依赖对底层任务的熟悉程度。此外,人类与语言模型之间的成本差距超过一个数量级,因为语言模型在可扩展性方面实现了类人水平的泛化和生成性能。
引用
@article{arxiv.2403.17860,
title = {Illuminating Blind Spots of Language Models with Targeted Agent-in-the-Loop Synthetic Data},
author = {Philip Lippmann and Matthijs T. J. Spaan and Jie Yang},
journal= {arXiv preprint arXiv:2403.17860},
year = {2024}
}
备注
Preprint. Under review