ViTCN:基于视觉Transformer对比网络的推理
计算机视觉与模式识别
2024-03-18 v1
摘要
机器学习模型在诸多领域取得显著进展,例如在计算机视觉中实现卓越的目标识别效果,在自然语言处理领域,像GPT这样的大型语言模型(LLM)已能以接近人类的水平与人类对话。然而,抽象推理仍是这些模型的挑战,AI是否真的能像人类一样思考仍是一个尚未解答的问题。Raven Progressive Matrices(RPM)是衡量人类推理能力的指标,它呈现一系列八个图像作为问题组,参与者需尝试发现这些图像之间的隐藏规律,并从八个可能的选项中选择最合适的一个来完成序列。该任务常被用于测试人类的推理能力和智商。Zhang等人提出了名为RAVEN的数据集,可用于测试机器学习模型的抽象推理能力。本文提出了基于对比感知推断网络(CoPiNet)的视觉Transformer对比网络,该网络在前期工作基础上设定了置换不变模型Raven Progressive Matrices的新基准,通过融合心理学、认知科学和教育学中的对比效应,进一步利用先进的视觉Transformer架构。该集成旨在进一步细化机器处理和推理来自像素级输入和RAVEN数据集上全局特征的空间时间信息能力。
引用
@article{arxiv.2403.09962,
title = {ViTCN: Vision Transformer Contrastive Network For Reasoning},
author = {Bo Song and Yuanhao Xu and Yichao Wu},
journal= {arXiv preprint arXiv:2403.09962},
year = {2024}
}
备注
5 pages, 2 figures , in proceeding of 5th International Seminar on Artificial Intelligence, Networking and Information Technology