中文

SIFOTL:面向表格学习的原则性、统计信息驱动的保真度优化方法

机器学习 2025-07-25 v1

摘要

识别驱动表格数据集数据漂移的因素是分析和决策支持系统中的重要挑战,尤其是那些关注医疗保健的系统。隐私规则限制数据访问,复杂过程引入的噪声阻碍分析。为解决此挑战,我们提出SIFOTL(Statistically-Informed Fidelity-Optimization Method for Tabular Learning),其包括:1)提取隐私合规的数据摘要统计信息;2)采用双 XGBoost 模型以辅助 LLM 置换干预信号与噪声;3)通过帕累托加权决策树合并 XGBoost 输出,以识别数据漂移负责的可解释分段。与可能忽略噪声或需要完全数据访问进行 LLM 基于分析的现有分析不同,SIFOTL仅使用隐私安全的摘要统计信息即可解决这两个挑战。为证明其实际有效性,针对模拟新 Medicare 药物补贴的MEPS面板数据集,SIFOTL 在识别接收补贴的分段方面 achieved 0.85 的 F1 分数,在 BigQuery 贡献分析(F1=0.46)和统计检验(F1=0.20)中显著优于。此外,在基于 Synthea ABM 生成的 18 个多样化 EHR 数据集上,SIFOTL 在无噪声情况下的 F1 分数维持在 0.86-0.96,即使注入观察噪声后也保持 >= 0.75,而基准平均 F1 分数在相同测试下范围为 0.19-0.67。因此,SIFOTL 提供了一个可解释、注重隐私的工作流程,在观察噪声下具有实证鲁棒性。

关键词

引用

@article{arxiv.2507.17979,
  title  = {SIFOTL: A Principled, Statistically-Informed Fidelity-Optimization Method for Tabular Learning},
  author = {Shubham Mohole and Sainyam Galhotra},
  journal= {arXiv preprint arXiv:2507.17979},
  year   = {2025}
}