利用合成数据释放大语言模型在核工业中的潜力
计算与语言
2025-06-11 v1
摘要
核工业拥有大量蕴藏在非结构化文本数据中的宝贵信息。然而,这些数据无法直接用于先进的大语言模型(LLM)应用,因为后者需要干净、结构化的问答对来完成模型训练、微调和评估等任务。本文探讨了合成数据生成如何弥合这一差距,从而推动核领域鲁棒大语言模型的开发。我们讨论了核工业中固有的数据稀缺和隐私问题,以及合成数据如何通过将现有文本数据转化为可用的问答对来提供解决方案。该方法利用大语言模型分析文本、提取关键信息、生成相关问题,并评估合成数据集的质量。通过释放大语言模型在核工业中的潜力,合成数据有望改善信息检索、促进知识共享,并为这一关键领域做出更明智的决策。
引用
@article{arxiv.2506.08750,
title = {Unlocking the Potential of Large Language Models in the Nuclear Industry with Synthetic Data},
author = {Muhammad Anwar and Daniel Lau and Mishca de Costa and Issam Hammad},
journal= {arXiv preprint arXiv:2506.08750},
year = {2025}
}