视觉-语言-动作模型综述
计算与语言
2025-06-03 v3 人工智能
计算机视觉与模式识别
摘要
本文介绍了由人工智能生成的视觉-语言-动作 (Vision-Language-Action, VLA) 模型综述,概述了关键方法、发现内容及未来方向。本文内容由大型语言模型 (Large Language Model, LLM) 生成,仅用于演示目的。本工作不代表原始研究,但突出了人工智能如何帮助自动化文献综述的潜力。随着 AI 生成内容的流行,确保其准确性、可靠性以及proper综合仍然是一个挑战。未来研究将致力于开发结构化框架,以便在 AI 辅助文献综述中探索技术,以提高引用准确性、来源可信度和上下文理解。通过审视 LLM 在学术写作中的潜力与局限性,本研究旨在为将 AI 融入研究工作流程的更广泛讨论做出贡献。本工作是建立系统方法以利用 AI 进行文献综述生成的初步步骤,旨在使学术知识的综合更加高效和可扩展。
引用
@article{arxiv.2502.06851,
title = {Survey on Vision-Language-Action Models},
author = {Adilzhan Adilkhanov and Amir Yelenov and Assylkhan Seitzhanov and Ayan Mazhitov and Azamat Abdikarimov and Danissa Sandykbayeva and Daryn Kenzhebek and Dinmukhammed Mukashev and Ilyas Umurbekov and Jabrail Chumakov and Kamila Spanova and Karina Burunchina and Madina Yergibay and Margulan Issa and Moldir Zabirova and Nurdaulet Zhuzbay and Nurlan Kabdyshev and Nurlan Zhaniyar and Rasul Yermagambet and Rustam Chibar and Saltanat Seitzhan and Soibkhon Khajikhanov and Tasbolat Taunyazov and Temirlan Galimzhanov and Temirlan Kaiyrbay and Tleukhan Mussin and Togzhan Syrymova and Valeriya Kostyukova and Yerkebulan Massalim and Yermakhan Kassym and Zerde Nurbayeva and Zhanat Kappassov},
journal= {arXiv preprint arXiv:2502.06851},
year = {2025}
}
备注
arXiv admin note: This submission has been withdrawn due to serious violation of arXiv policies for acceptable submissions