评估交互式二维可视化作为生物医学时间序列数据标注的样本选择策略
机器学习
2026-03-30 v1 人工智能
人机交互
摘要
生物医学环境中的可靠机器学习模型依赖于准确的标签,但标注生物医学时间序列数据仍然具有挑战性。算法样本选择可以支持标注,但涉及真实人类标注者的研究证据仍然稀缺。因此,我们比较了三种标注样本选择方法:随机采样(RND)、最远优先遍历(FAFT),以及一种基于图形用户界面的方法,可探索高维数据的互补二维可视化(2DVs)。我们在婴儿运动评估(IMA)和语音情感识别(SER)四个分类任务中评估了这些方法。十二名标注者分为专家和非专家,在有限标注预算下执行数据标注,标注后实验用于评估采样方法。在所有分类任务中,2DV在跨标注者聚合标签时表现最佳。在IMA中,2DV最有效地捕捉了稀有类别,但也表现出更大的标注者间标签分布变异性,这是由于有限的标注预算导致的;当模型在单个标注者的标签上训练时,分类性能下降,在这些情况下FAFT表现优异。对于SER,2DV在专家标注者中优于其他方法,在单个标注者设置中与非专家标注者的表现相当。失败风险分析显示,当标注者数量或标注者专业性不确定时,RND是最安全的选择,而2DV由于其更大的标签分布变异性而具有最高风险。此外,标注后访谈表明2DV使标注任务更有趣和愉快。总体而言,基于2DV的采样在生物医学时间序列数据标注中前景广阔,特别是在标注预算不受严格限制的情况下。
引用
@article{arxiv.2603.26592,
title = {Evaluating Interactive 2D Visualization as a Sample Selection Strategy for Biomedical Time-Series Data Annotation},
author = {Einari Vaaras and Manu Airaksinen and Okko Räsänen},
journal= {arXiv preprint arXiv:2603.26592},
year = {2026}
}