基于预训练语言模型的上下文感知数据插补方法
计算与语言
2025-03-28 v2 机器学习
摘要
本文提出一种新方法,称为 \textbf{C}ontextually \textbf{R}elevant \textbf{I}mputation leveraging pre-trained \textbf{L}anguage \textbf{M}odels(CRILM),用于处理表格数据中的缺失值。与传统的数值估计方法不同,CRILM 使用预训练语言模型(LMs)为缺失值创建具有上下文相关性的描述符。该方法将数据集与语言模型的优势相匹配,使大型语言模型能够生成这些描述符,而小型语言模型则可以在丰富后的数据集上进行微调,以提高下游任务的性能。我们的评估表明,CRILM 在 MCAR、MAR 和具有挑战性的 MNAR 场景中均表现出优越性和稳健性,最佳基线方法性能可提升最高 10%。通过缓解偏差,尤其是在 MNAR 设置下,CRILM 改善了下游任务的性能,提供了一种面向资源受限环境的经济实惠解决方案。
引用
@article{arxiv.2405.17712,
title = {A Context-Aware Approach for Enhancing Data Imputation with Pre-trained Language Models},
author = {Ahatsham Hayat and Mohammad Rashedul Hasan},
journal= {arXiv preprint arXiv:2405.17712},
year = {2025}
}