中文

评估大语言模型支持预期性影响评估的能力

计算与语言 2024-05-22 v2 人工智能 计算机与社会

摘要

洞察新兴人工智能(AI)技术对社会的潜在负面影响,是实施预期性治理方法的一项挑战。产生此类洞察的一种方法是使用大语言模型(LLMs)来支持和指导专家构思和探索新兴技术可能带来的不良后果。然而,仍需对 LLMs 在此类任务上的性能进行评估,包括检查生成影响的一般质量,以及所产生影响的类型范围和由此产生的偏差。在本文中,我们通过在新媒体文章的多样化样本上微调补全模型(GPT-3 和 Mistral-7B),并将这些输出与基于指令的模型(GPT-4 和 Mistral-7B-Instruct)生成的影响进行比较,展示了生成高质量、多样化 AI 社会影响的潜力。我们检查了生成影响的一致性、结构、相关性和合理性,发现使用 Mistral-7B(一个在新闻媒体影响上微调的小型开源模型)生成的影响在质量上往往与使用能力更强、规模更大的模型(如 GPT-4)生成的影响相当。此外,我们发现,与微调模型相比,基于指令的模型生成的影响在某些类别上存在缺失。这项研究揭示了最先进 LLM 在生成影响范围上的潜在偏差,以及将较小的 LLM 与新闻媒体对齐作为一种可扩展的替代方案,以生成高质量且更多样化的影响,从而支持预期性治理方法的潜力。

关键词

引用

@article{arxiv.2401.18028,
  title  = {Evaluating the Capabilities of LLMs for Supporting Anticipatory Impact Assessment},
  author = {Mowafak Allaham and Nicholas Diakopoulos},
  journal= {arXiv preprint arXiv:2401.18028},
  year   = {2024}
}

备注

10 pages + research ethics and social impact statement, references, and appendix. Under conference review