面向双相躁狂检测的边缘设备特征-状态解耦的混合精度信息瓶颈
机器学习
2026-05-06 v1 人工智能
人机交互
声音
摘要
通过语音生物标志物持续监测双相躁狂患的烦躁状态,需要在资源受限的边缘设备上将稳定的说话人特征与波动的情绪状态解耦。我们引入 MP-IB 框架,将混合精度量化视为临床特征-状态分离的信息瓶颈。核心洞察在于:数值精度本身控制了容量:FP16 特征头(1024 位)编码说话人身份,而 INT4 状态头(128 位)捕获烦躁状态,实现 8 倍信息不对称,无需对抗训练。我们引入动态精度调度和多尺度时序融合。在 Bridge2AI-Voice 数据集上(N=833,每个受试者 4 次会话,严格说话人独立交叉验证),MP-IB 实现 rho=0.117(95% 置信区间:[0.089, 0.145],p=0.003,显著优于 9400 万参数 WavLM-Adapter 的原位自监督学习延续(rho=-0.042)、beta-VAE 解耦(rho=0.089)以及手工声学特征(rho=0.031),提升 2.8--15.9 分。零样本迁移至 CREMA-D 数据集实现 AUC=0.817。身份泄露被压制至接近随机水平(EER=0.42,MIA-AUC=0.52)。端到端延迟为 23.4 毫秒,仅 617 KB 内存 footprint,使其能够在价值不到 20 美元的设备上实现实时监测。
引用
@article{arxiv.2605.03039,
title = {Mixed-Precision Information Bottlenecks for On-Device Trait-State Disentanglement in Bipolar Agitation Detection},
author = {Joydeep Chandra},
journal= {arXiv preprint arXiv:2605.03039},
year = {2026}
}