面向68个公共生理语料库的可审计规则发现的多分析师LLM流水线
信号处理
2026-07-07 v1 人工智能
摘要
开放的生理语料库具有异质性:它们使用不同的传感器、标签、采样率、记录设置和临床终点。它们可以支持检测器设计,但不能直接指定应为新的非接触式监测平台构建哪些检测器规则。我们报告了一个受控的四分析师大语言模型(LLM)工作流程,将68个经商业使用兼容性筛选的公共生理语料库转换为用于前瞻性验证的可审计候选规则形状库。四个独立的商业LLM系列在受控提示下阅读语料库文档,产生了695个候选规则标记(顶级标记)。去重保留了649条规则记录;阈值边界审计随后标记了51个需要钳制或策展人审查的合理性违规。跨语料库整合产生了436个独特的规则形状。针对两个硬不变量(原生目标硬件通道可用性和无多夜每患者个性化)的门控标记,确定了跨四个检测器族桶的94个可立即构建的检测器组件。该流水线不产生经过验证的临床检测器。它产生了一个可审计的工程级联,其中分析师分歧、阈值检查、策展人审查和自动化持续集成(CI)检查将文献衍生的规则导向前瞻性硬件验证。
引用
@article{arxiv.2607.06802,
title = {A Multi-Analyst LLM Pipeline for Auditable Rule Discovery Across 68 Public Physiological Corpora},
author = {Dovy Paukstys},
journal= {arXiv preprint arXiv:2607.06802},
year = {2026}
}
备注
8 pages, 2 figures, 9 tables; submitted to IEEE SPMB 2026