中文

免费游玩:UNCTAD开发自身开源检索增强生成式语言模型应用程序的经验

计算机与社会 2024-07-25 v1 人工智能 计算与语言 机器学习

摘要

生成式人工智能(AI),特别是大语言模型(LLM),自2022年11月ChatGPT发布其生成式预训练变换器(GPT)3.5模型以来,迎来了快速增长的流行度和关注度。由于这些通用模型的强大功能及其能够用自然语言交流的能力,它们在包括官方统计数据和国际组织工作在内的广泛领域都具有实用价值。然而,面对这种新颖且似乎复杂的技术,组织内部可能感到这种生成式AI是一种发生在他们身上的现象,一种可以被讨论却无法理解、可以被评论却无法贡献的事物。此外,专有解决方案的采纳和运行成本往往是不确定且较高的,这会成为常年处于紧张财政状况的国际组织的障碍。在这种挑战面前,联合国贸易与发展组织(UNCTAD)通过其全球危机响应小组(GCRG),探索并开发了自己的开源检索增强生成式语言模型应用程序。RAG技术使大语言模型能够了解并更好地服务于该组织的领域和工作。内部开发解决方案虽然既有优势也有劣势,其中优势包括成本、灵活性以及培养机构知识;劣势包括时间和技能投入,以及功能和性能方面的不足。为生产该应用程序开发了四个库:nlp_pipeline用于文档处理和统计分析,local_rag_llm用于运行本地RAG大语言模型,streamlit_rag用于用户界面,所有库均在PyPI和GitHub上公开提供,并附带Docker镜像。第四个库local_llm_finetune也可用于微调现有大语言模型,以便在应用程序中使用。

关键词

引用

@article{arxiv.2407.16896,
  title  = {Free to play: UN Trade and Development's experience with developing its own open-source Retrieval Augmented Generation Large Language Model application},
  author = {Daniel Hopp},
  journal= {arXiv preprint arXiv:2407.16896},
  year   = {2024}
}