中文

大语言模型处理冗余信息推理能力的分析

计算与语言 2023-10-09 v1

摘要

大语言模型(LLMs)近期的进展在一系列自然语言处理任务中展现出令人印象深刻的能力,尤其在推理这一实现通用人工智能(AGI)的基石方面。然而,常用基准可能无法充分囊括这些模型在真实场景中的推断能力。为弥补此差距,引入了一种新型问答(QA)任务,称为提供冗余信息推理(RRIP)。本研究设计了grade school math 8K(GSM-8K)数据集的修改版本,其具有关注冗余信息不同属性的若干变体。该调研评估了两种流行LLM,LlaMA2-13B-chat与生成式预训练transformer 3.5(GPT-3.5),对比它们在传统QA任务与RRIP任务上的表现。结果表明,尽管这些模型在标准QA基准上取得中等成功,其在RRIP任务上的表现明显下降。该研究不仅凸显了当前LLMs处理冗余信息的局限,也建议未来这些模型的训练应聚焦于将冗余信息纳入训练数据以提升在RRIP任务上的表现。

关键词

引用

@article{arxiv.2310.04039,
  title  = {Analysis of the Reasoning with Redundant Information Provided Ability of Large Language Models},
  author = {Wenbei Xie},
  journal= {arXiv preprint arXiv:2310.04039},
  year   = {2023}
}