面向多跳推理的亲属关系数据基准
计算与语言
2026-01-13 v1 人工智能
摘要
大型语言模型(LLMs)正在被评估其执行多跳推理能力,即将多个信息组合成连贯推断的能力。我们引入KinshipQA,一个通过对亲属关系进行推理来探测这一能力的基准测试。本工作的核心贡献是一种生成式管道,能够按需产生大规模、真实且具有特定文化背景的家族数据:满足不同亲属系统相关联明确婚姻约束的相互关联的家庭树集合。这使得可以系统地控制和变异任务难度、文化假设以及关系深度。从这些家谱中,我们推导出需要对隐式关系链进行推理的文本推理任务。我们在六个最先进的LLMs上对结果基准进行评估,这些模型涵盖了开源和闭源模型,并采用统一的零-shot协议进行确定性解码。以精确匹配和集合为基础的指标衡量性能。我们的结果表明,KinshipQA产生了广泛的结果,并在不同模型和文化环境之间暴露出系统性差异。
引用
@article{arxiv.2601.07794,
title = {Kinship Data Benchmark for Multi-hop Reasoning},
author = {Tianda Sun and Dimitar Kazakov},
journal= {arXiv preprint arXiv:2601.07794},
year = {2026}
}
备注
11 pages, 2 figures, 9 tables