大语言模型能找到绿色圆圈吗?面向组合泛化的探究与人机协同工具操控
计算与语言
2023-12-14 v1
摘要
自然语言中复杂短语的含义由其各个组成部分组合而成。组合泛化任务评估模型理解组件新组合的能力。以往研究训练较小的、任务特定的模型,这些模型表现出较差的泛化能力。虽然大语言模型(LLMs)通过上下文学习(ICL)在许多任务上展现出令人印象深刻的泛化能力,但其在组合泛化方面的潜力尚未被探索。本文首先实证研究了组合泛化中主流的上下文学习方法。我们发现,由于长推理步骤中的累积误差以及工具制造所需的复杂逻辑,这些方法难以处理复杂的组合性问题。为此,我们提出了一种人机协同工具操控框架(HTM),该框架为子问题生成工具并整合多种工具。我们的方法以最少的人力投入提升了工具创建与使用的有效性。实验表明,我们的方法在两个组合泛化基准测试上达到了最先进的性能,并在最具挑战性的测试集上比现有方法高出70%。
引用
@article{arxiv.2312.07763,
title = {Can LLM find the green circle? Investigation and Human-guided tool manipulation for compositional generalization},
author = {Min Zhang and Jianfeng He and Shuo Lei and Murong Yue and Linhang Wang and Chang-Tien Lu},
journal= {arXiv preprint arXiv:2312.07763},
year = {2023}
}
备注
Accepted by ICASSP 2024