使用生成式人工智能个人助理工具评估特定任务的生产力提升
人机交互
2024-10-01 v2
摘要
本研究评估了使用由 Trane Technologies 开发的生成式人工智能个人助理工具(PAT)所实现的生产力提升。该 PAT 基于 OpenAI 的 GPT 3.5 模型,部署在 Microsoft Azure 上以确保安全访问和知识产权保护。为评估该工具的生产力有效性,进行了一项实验,比较了四项常见办公任务的完成时间和内容质量:撰写电子邮件、总结文章、为简单任务创建说明以及准备演示大纲。63 名参与者被随机分为使用 PAT 的测试组和手动执行任务的对照组。结果表明,生产力有显著提升,特别是在涉及总结和创建说明的任务中,提升幅度从 3.3% 到 69% 不等。研究进一步分析了用户年龄、响应字数和响应质量等因素,发现 PAT 用户生成了更冗长且质量更高的内容。采用 GPT-4 的“LLM-as-a-judge”方法被用于对响应质量进行评分,该方法有效区分了高质量和低质量的输出。研究结果强调了 PAT 在提升工作场所生产力方面的潜力,并指出了进一步研究和优化的方向。
引用
@article{arxiv.2409.14511,
title = {Evaluation of Task Specific Productivity Improvements Using a Generative Artificial Intelligence Personal Assistant Tool},
author = {Brian S. Freeman and Kendall Arriola and Dan Cottell and Emmett Lawlor and Matt Erdman and Trevor Sutherland and Brian Wells},
journal= {arXiv preprint arXiv:2409.14511},
year = {2024}
}
备注
18 pages, 9 figures