大型语言模型在将非结构化文本转换为标准格式方面的有效性
人工智能
2025-05-06 v2 计算与语言
摘要
非结构化文本数据的指数级增长为现代数据管理和信息检索带来了根本性挑战。尽管大型语言模型(LLM)在自然语言处理方面展现出惊人的能力,但其将非结构化文本转化为标准化、结构化格式的潜力仍未得到广泛探索——这一能力若能实现,将彻底改变跨行业的数据处理工作流程。本研究开创性地系统评估了LLM将非结构化食谱文本转换为结构化Cooklang格式的能力。通过对四种模型(GPT-4o、GPT-4o-mini、Llama3.1:70b和Llama3.1:8b)进行全面测试,本文引入了一种创新的评估方法,将传统指标(WER、ROUGE-L、TER)与语义元素识别的专用指标相结合。我们的实验结果表明,GPT-4o通过少量样本提示实现了突破性性能(ROUGE-L: 0.9722,WER: 0.0730),首次证明LLM能够在无需大量训练的情况下可靠地将特定领域的非结构化文本转换为结构化格式。尽管模型性能通常随规模而提升,我们意外发现更小的模型如Llama3.1:8b在通过针对性微调方面展现出巨大的潜力。这些发现为跨领域自动化结构化数据生成开辟了新可能,从医疗记录到技术文档,可能彻底改变组织处理和利用非结构化信息的方式。
引用
@article{arxiv.2503.02650,
title = {The Effectiveness of Large Language Models in Transforming Unstructured Text to Standardized Formats},
author = {William Brach and Kristián Košťál and Michal Ries},
journal= {arXiv preprint arXiv:2503.02650},
year = {2025}
}