PuzzleGPT:模拟人类解谜能力进行时间和位置预测
计算机视觉与模式识别
2025-01-27 v1 人工智能
机器学习
摘要
从图像预测时间和位置是一个具有挑战性的任务,需要对不同线索具有复杂的人类类似解谜能力。在本工作中,我们将这种能力形式化为核心技能,并通过称为 PuzzleGPT 的专家管道中的不同模块实现。PuzzleGPT 包括一个感知器用于识别视觉线索、一个推理器用于推导预测候选者、一个组合器用于组合来自不同线索的信息、一个 web 检索器用于获取无法在本地解决任务时的外部知识,以及一个噪声过滤器用于鲁棒性。这导致了一个零样本、可解释且鲁棒的方法,在两个数据集 -- TARA 和 WikiTilo 上实现了业界最高的性能。PuzzleGPT 超过了诸如 BLIP-2、InstructBLIP、LLaVA 以及 GPT-4V 等大型 VLMs,至少提高了 32% 和 38%,甚至与微调模型相当或优于。
引用
@article{arxiv.2501.14210,
title = {PuzzleGPT: Emulating Human Puzzle-Solving Ability for Time and Location Prediction},
author = {Hammad Ayyubi and Xuande Feng and Junzhang Liu and Xudong Lin and Zhecan Wang and Shih-Fu Chang},
journal= {arXiv preprint arXiv:2501.14210},
year = {2025}
}
备注
NAACL 2025 Findings