中文

ViTCN:基于视觉Transformer对比网络的推理

计算机视觉与模式识别 2024-03-18 v1

摘要

机器学习模型在诸多领域取得显著进展,例如在计算机视觉中实现卓越的目标识别效果,在自然语言处理领域,像GPT这样的大型语言模型(LLM)已能以接近人类的水平与人类对话。然而,抽象推理仍是这些模型的挑战,AI是否真的能像人类一样思考仍是一个尚未解答的问题。Raven Progressive Matrices(RPM)是衡量人类推理能力的指标,它呈现一系列八个图像作为问题组,参与者需尝试发现这些图像之间的隐藏规律,并从八个可能的选项中选择最合适的一个来完成序列。该任务常被用于测试人类的推理能力和智商。Zhang等人提出了名为RAVEN的数据集,可用于测试机器学习模型的抽象推理能力。本文提出了基于对比感知推断网络(CoPiNet)的视觉Transformer对比网络,该网络在前期工作基础上设定了置换不变模型Raven Progressive Matrices的新基准,通过融合心理学、认知科学和教育学中的对比效应,进一步利用先进的视觉Transformer架构。该集成旨在进一步细化机器处理和推理来自像素级输入和RAVEN数据集上全局特征的空间时间信息能力。

关键词

引用

@article{arxiv.2403.09962,
  title  = {ViTCN: Vision Transformer Contrastive Network For Reasoning},
  author = {Bo Song and Yuanhao Xu and Yichao Wu},
  journal= {arXiv preprint arXiv:2403.09962},
  year   = {2024}
}

备注

5 pages, 2 figures , in proceeding of 5th International Seminar on Artificial Intelligence, Networking and Information Technology