利用大语言模型为小众领域创建内容语料库
计算与语言
2025-08-01 v2 人工智能
计算机与社会
摘要
从海量、非结构化的网络资源中为特定领域应用构建专门的内容语料库,面临着巨大的数据管理挑战。在本文中,我们介绍了一种通过高效获取、过滤、结构化和清洗基于网络的数据来生成高质量、特定领域语料库的简化方法。我们展示了如何利用大语言模型(LLM)来解决大规模复杂的数据管理问题,并提出了一个整合了LLM增强技术的战略框架,用于结构化内容提取和语义去重。我们通过将其集成到习惯养成应用“30 Day Me”中,在行为教育领域验证了我们的方法。我们的数据管道,名为30DayGen,从超过15,000个网页中提取并合成了3,531个独特的30天挑战。一项用户调查报告满意度得分为4.3分(满分5分),91%的受访者表示愿意将策划的内容用于他们的习惯养成目标。
引用
@article{arxiv.2505.02851,
title = {Leveraging LLMs to Create Content Corpora for Niche Domains},
author = {Franklin Zhang and Sonya Zhang and Alon Halevy},
journal= {arXiv preprint arXiv:2505.02851},
year = {2025}
}
备注
9 pages (main content), 5 figures. Supplementary materials can be found at https://github.com/pigfyy/30DayGen-Supplementary-Materials