arXiv:2609.05079 · 2026-09-04 · 预印本
- 40 个来自同行评审研究的盲任务(跨 10 个学科),只给目标与冻结数据、隐藏结论与路径;LLM 评委按 6 维证据成熟度打分。结果:4 个主流编码智能体挤在 58–60 分窄平台——执行分析≠做出发现。
- 看点:给"AI 科研"祛魅的重要基准——做科研 Agent 的人(包括 EurekaClaw 类工具的使用者)都该知道这条上限曲线。
- 🔗 打开原文
本文摘自《每日前沿研究简报 · 2026-09-07》「五、AI 科研:会执行 ≠ 会发现(本站 AI 科研频道的对口前沿)」。本内容仅用于研究信息整理与科普交流,不构成医疗建议。

发表评论 取消回复