VTutor:一个面向生成式人工智能驱动的动画教学代理与多媒体输出的开源 SDK
人机交互
2025-02-14 v2 人工智能
软件工程
摘要
大语言模型(LLMs)的快速发展已经改变了人机交互(HCI),但目前与 LLMs 的交互主要集中在基于文本的交互上,而其他多模态方法仍处于探索不足的状态。本文介绍了 VTutor,这是一个开源软件开发工具包(SDK),它将生成式人工智能与先进的动画技术相结合,为人类与人工智能的多媒体交互创建引人入胜、适应性强且逼真的动画教学代理(APA)。VTutor 利用 LLM 进行实时个性化反馈,利用先进的唇形同步实现自然的语音对齐,并利用 WebGL 渲染实现无缝的网页集成。VTutor 支持多种 2D 和 3D 角色模型,使研究人员和开发人员能够设计出情感共鸣、情境适应的学习代理。该工具包增强了学习者参与度、反馈接受度以及人机交互,同时促进了教育中可信人工智能的原则。VTutor 为下一代动画教学代理设立了新标准,为培养有意义且沉浸式的人机交互体验提供了一个可访问、可扩展的解决方案。VTutor 项目已开源,欢迎社区驱动的贡献和展示。
引用
@article{arxiv.2502.04103,
title = {VTutor: An Open-Source SDK for Generative AI-Powered Animated Pedagogical Agents with Multi-Media Output},
author = {Eason Chen and Chenyu Lin and Xinyi Tang and Aprille Xi and Canwen Wang and Jionghao Lin and Kenneth R Koedinger},
journal= {arXiv preprint arXiv:2502.04103},
year = {2025}
}