uTalk:弥合人类与 AI 之间的鸿沟
人机交互
2023-12-14 v2
摘要
大语言模型(LLM)凭借其能力提升了各领域生产力并助力学习,已革新多个行业。一个引人入胜的应用是将 LLM 与视觉模型结合,创造一种新的人机交互方式。该系统的核心思想是构建一个用户友好的平台,使人们在日常生活中能利用 ChatGPT 的功能。uTalk 由 Whisper、ChatGPT、Microsoft Speech Services 以及最先进的(SOTA)说话头系统 SadTalker 等技术组成。用户可与数字分身进行类人对话并获取任意问题的解答。此外,uTalk 可通过提交图像与输入(文本或音频)生成内容。该系统托管于 Streamlit,用户需提供一张图像作为 AI 助手。随后,在提供输入(文本或音频)后,一系列操作将生成带有精确回复的虚拟形象视频。本文阐述了基于每秒 25 帧(FPS)生成视频,SadTalker 的运行时间优化了 27.69%,相较于我们的 20FPS 生成视频优化了 38.38%。此外,SadTalker 与 Streamlit 的集成与并行化使系统相较初始性能提升了 9.8%。
引用
@article{arxiv.2310.02739,
title = {uTalk: Bridging the Gap Between Humans and AI},
author = {Hussam Azzuni and Sharim Jamal and Abdulmotaleb Elsaddik},
journal= {arXiv preprint arXiv:2310.02739},
year = {2023}
}