从模板到自然语言:面向空间推理的指令微调 LLM 中的泛化挑战
计算与语言
2025-08-19 v2
摘要
指令微调的大型语言模型(LLM)在各种任务上表现出色;然而,在具身环境中从合成指令泛化到人类编写的指令对它们来说仍然是一个挑战。在这项工作中,我们研究了空间定位任务中的泛化挑战,在这些任务中,模型解释并翻译指令以在 D 网格上构建物体排列。我们仅使用合成指令对 LLM 进行微调,并在包含合成和人类编写指令的基准数据集上评估其性能。我们的结果表明,虽然模型在简单任务上泛化良好,但其在更复杂任务上的性能显著下降。我们对指令泛化方面的差距进行了详细的错误分析。
引用
@article{arxiv.2505.14425,
title = {From Templates to Natural Language: Generalization Challenges in Instruction-Tuned LLMs for Spatial Reasoning},
author = {Chalamalasetti Kranti and Sherzod Hakimov and David Schlangen},
journal= {arXiv preprint arXiv:2505.14425},
year = {2025}
}
备注
17 pages