中文

多感官人工智能的数学基础

机器学习 2024-05-01 v1 人工智能 计算与语言 计算机视觉与模式识别 多媒体

摘要

构建从文本、语音、视频、真实世界传感器、可穿戴设备和医疗数据等多个感官输入中学习的多感官AI系统在许多具有实际益处的科学领域具有巨大的潜力,例如支持人类健康福祉、实现多媒体内容处理以及增强现实世界自主智能体。通过综合多种理论框架和应用领域,本论文旨在推进多感官AI的机器学习基础。在第一部分,我们提出了形式化模态如何相互作用以产生任务新信息的理论框架。这些相互作用是所有多模态问题的基本构件,其量化使用户能够理解其多模态数据集、设计原则的方法来学习这些相互作用,并分析其模型是否成功学习。在第二部分,我们研究了面向多个模态和任务的实用多模态基础模型的设计,这是通向将大型语言模型 grounding 到真实世界感官模态的一个步骤。我们引入MultiBench,一个涵盖广泛模态、任务和研究领域的统一大型基准,随后是支持今天许多多模态基础模型的跨模态注意力和多模态变换器架构。对这些架构在MultiBench上的规模化使创建通用多感官AI系统成为可能,并讨论了我们在情感计算、心理健康、癌症预后和机器人等领域的合作实践。最后,我们本论文结尾讨论了未来工作如何利用这些想法 toward 更通用、交互式和安全的多感官AI。

关键词

引用

@article{arxiv.2404.18976,
  title  = {Foundations of Multisensory Artificial Intelligence},
  author = {Paul Pu Liang},
  journal= {arXiv preprint arXiv:2404.18976},
  year   = {2024}
}

备注

CMU Machine Learning Department PhD Thesis