面向生物信号多模态预训练的频率感知掩码自编码器
机器学习
2024-04-22 v2 人工智能
信号处理
摘要
利用生物信号中的多模态信息对于构建人体身心状态的全面表征至关重要。然而,由于任务定义的变化或模态构成的差异,多模态生物信号在预训练与推断数据集之间往往表现出显著的分布偏移。为在潜在分布偏移下实现有效预训练,我们提出一种频率感知掩码自编码器(FAME),其学习在频率空间中参数化生物信号的表征。FAME 引入了一个频率感知 transformer,它利用基于 Fourier 的固定尺寸算子进行全局 token 混合,且与输入的长度和采样率无关。为保持各输入通道内的频率分量,我们进一步采用一种在潜空间执行掩码自编码的频率保持预训练策略。所得到的架构在预训练期间有效利用多模态信息,并可在测试时无缝适配不同任务与模态,而不受输入尺寸与顺序影响。我们在单模态时间序列的多样化迁移实验上评估了该方法,分类准确率较先前最优水平平均提升 5.5%。此外,我们证明了该架构在模态失配场景(包括不可预测的模态丢弃或替换)下具有鲁棒性,印证了其在现实应用中的实用价值。代码见 https://github.com/apple/ml-famae 。
引用
@article{arxiv.2309.05927,
title = {Frequency-Aware Masked Autoencoders for Multimodal Pretraining on Biosignals},
author = {Ran Liu and Ellen L. Zippi and Hadi Pouransari and Chris Sandino and Jingping Nie and Hanlin Goh and Erdrin Azemi and Ali Moin},
journal= {arXiv preprint arXiv:2309.05927},
year = {2024}
}
备注
Extended version of ICLR 2024 Learning from Time Series for Health workshop