用于AI教练的视觉编码器-解码器模型
计算机视觉与模式识别
2023-11-29 v1 人工智能
摘要
本研究论文通过集成视觉编码器-解码器模型,提出了一种创新的AI教练方法。该方法的可行性通过使用Vision Transformer作为编码器和GPT-2作为解码器得到验证,实现了视觉输入与文本交互的无缝集成。不同于采用独立模型进行图像识别和基于文本 coaching 的传统做法,我们的集成架构直接处理输入图像,实现与AI教练的自然问答对话。这一独特策略简化了模型架构,同时提升了人机交互中的整体用户体验。我们展示了示例结果以证明模型的能力。结果凸显了该方法论作为一种有前景的范式,可在涉及视觉输入的多个领域中创建高效的AI教练模型。重要的是,无论所选的具体视觉编码器或文本解码器如何,这一潜力均成立。此外,我们使用不同规模的GPT-2进行了实验,以评估其对AI教练性能的影响,为我们所提方法的可扩展性与通用性提供了有价值的见解。
引用
@article{arxiv.2311.16161,
title = {Vision Encoder-Decoder Models for AI Coaching},
author = {Jyothi S Nayak and Afifah Khan Mohammed Ajmal Khan and Chirag Manjeshwar and Imadh Ajaz Banday},
journal= {arXiv preprint arXiv:2311.16161},
year = {2023}
}
备注
6 pages, 2 figures