探索利用生成式人工智能支持视觉场景显示的自动化即时编程
人机交互
2024-08-22 v1
摘要
全球数百万人依赖辅助与替代沟通设备进行交流。视觉场景显示(VSDs)可通过将沟通选项嵌入情境化图像来增强这些个体的沟通能力。然而,现有的 VSDs 往往呈现默认图像,可能缺乏相关性或需要手动配置,给沟通伙伴带来沉重负担。本研究中,我们评估了利用大型多模态模型(LMM),如 GPT-4V,为 VSDs 自动生成沟通选项的可行性。沟通选项由 LMM 和言语-语言病理学家(SLPs)以及 AAC 研究者(N=13)提供,并通过 SLPs 和 AAC 研究者进行的专家评估进行评价。我们呈现了研究结果,并补充了来自半结构化访谈(N=5)关于 SLPs 和 AAC 研究者对生成式人工智能在辅助与替代沟通设备中使用的观点的见解。我们的结果表明,LMM 生成的沟通选项在情境上是相关的,并且通常与人类创建的选项相似。然而,在 LMM 能够被自信地部署于 AAC 设备之前,仍有重要问题需要解决。
引用
@article{arxiv.2408.11137,
title = {Exploring the use of Generative AI to Support Automated Just-in-Time Programming for Visual Scene Displays},
author = {Cynthia Zastudil and Christine Holyfield and Christine Kapp and Xandria Crosland and Elizabeth Lorah and Tara Zimmerman and Stephen MacNeil},
journal= {arXiv preprint arXiv:2408.11137},
year = {2024}
}