DSAI:数据中心人工智能中无偏好且可解释的潜在特征提取
机器学习
2025-02-19 v2 人工智能
摘要
大型语言模型(LLM)常常因依赖预训练知识而非实际数据模式,难以客观识别大数据集中的潜在特征。为解决数据 grounding 问题,我们提出数据科学家人工智能(DSAI),一个通过多阶段管道并具备可量化显著性指标来评估提取特征的框架,实现无偏好且可解释的特征提取。在具有已知ground-truth特征的合成数据集上,DSAI在识别专家定义特征方面表现出高召回率,同时忠实地反映底层数据。应用于真实数据集时,框架在发现具有最小专家监督的有意义模式方面展现实用价值,支持诸如可解释分类等用例。本文标题根据DSAI生成的准则从多个候选标题中选择。
引用
@article{arxiv.2412.06303,
title = {DSAI: Unbiased and Interpretable Latent Feature Extraction for Data-Centric AI},
author = {Hyowon Cho and Soonwon Ka and Daechul Park and Jaewook Kang and Minjoon Seo and Bokyung Son},
journal= {arXiv preprint arXiv:2412.06303},
year = {2025}
}