中文

从任务执行器到研究伙伴:通过生物医学研究中的工作流集成评估AI协同助手

人工智能 2025-12-05 v1

摘要

人工智能系统正越来越多地部署于生物医学研究中。然而,现有的评估框架可能无法充分评估其作为研究协作者的有效性。本快速综述考察了临床前生物医学研究中AI系统的基准测试实践。检索了三个主要数据库和两个预印本服务器(2018年1月1日至2025年10月31日),识别出14项评估AI在文献理解、实验设计和假设生成方面能力的基准测试。结果显示,所有现有基准测试均评估孤立组件能力,包括数据分析质量、假设有效性和实验方案设计。然而,真正的研究协作需要跨越多个会话的集成工作流,包括上下文记忆、自适应对话和约束传播。这一差距意味着在组件基准测试上表现优异的系统可能在实践中作为研究协作者时失效。本文提出了一种面向过程的评估框架,涵盖当前基准测试中缺失的四个关键维度:对话质量、工作流编排、会话连续性和研究者体验。这些维度对于将AI系统评估为研究协作者而非孤立任务执行器至关重要。

关键词

引用

@article{arxiv.2512.04854,
  title  = {From Task Executors to Research Partners: Evaluating AI Co-Pilots Through Workflow Integration in Biomedical Research},
  author = {Lukas Weidener and Marko Brkić and Chiara Bacci and Mihailo Jovanović and Emre Ulgac and Alex Dobrin and Johannes Weniger and Martin Vlas and Ritvik Singh and Aakaash Meduri},
  journal= {arXiv preprint arXiv:2512.04854},
  year   = {2025}
}