中文

大语言模型是优秀的数据预处理器吗?

计算与语言 2025-02-25 v1

摘要

高质量的文本训练数据对于多模态数据处理任务的成功至关重要,然而来自 BLIP 和 GIT 等图像描述模型的输出通常包含错误和异常,难以使用基于规则的方法进行纠正。虽然近期解决此问题的工作主要集中在使用 GPT 模型对相对简单的公开数据集进行数据预处理,但仍需探索更广泛的大语言模型(LLM)并处理更具挑战性和多样性的数据集。在本研究中,我们考察了多种 LLM 的使用,包括 LLaMA 3.1 70B、GPT-4 Turbo 和 Sonnet 3.5 v2,以优化和清洗 BLIP 和 GIT 的文本输出。我们通过比较在清洗后和未清洗数据上训练的下游任务(SemEval 2024 子任务“表情包中的多标签说服检测”)模型,来评估 LLM 辅助数据清洗的影响。尽管我们的实验结果显示使用 LLM 清洗后的描述有所改善,但统计检验表明大多数改善并不显著。这表明,虽然 LLM 有潜力增强数据清洗和修复,但根据其应用上下文、任务复杂性和文本噪声水平,其有效性可能受到限制。我们的发现强调了对 LLM 在数据预处理流水线中的能力和局限性进行进一步研究的必要性,特别是在处理具有挑战性的数据集时,为关于将 LLM 集成到数据预处理流水线中的持续讨论提供了实证证据。

关键词

引用

@article{arxiv.2502.16790,
  title  = {Are Large Language Models Good Data Preprocessors?},
  author = {Elyas Meguellati and Nardiena Pratama and Shazia Sadiq and Gianluca Demartini},
  journal= {arXiv preprint arXiv:2502.16790},
  year   = {2025}
}