arXiv 预印本 · 2026-09-09 · 预印本 · Yash Rajeshbhai Parikh
- 场景:微服务事故诊断。核心工具 TCA(Telemetry Claim Adjudicator) 是一个不依赖结果标签的机械裁决器,逐条裁定 LLM 智能体在诊断中引用的遥测断言是否有依据。
- 配套制品:6 种架构臂 × 2 个基准的诊断 harness;以 SHA-256 请求号索引的推理台账——论文中每个数字都能回溯到原始请求–响应对;4 轮盲审人评(352 条断言,附带评分者看过的材料、被隐藏的判定键、逐条判定与理由,以及读第一条前就固定的评分量表)。
- 可复现性:
./reproduce.sh check秒级运行、无需数据与凭据,用两条独立路径重算论文所有量,并校验手稿格式、引文(Crossref/arXiv)与 README 自身数字;CLAIMS.md把每条论断映射到生成命令,并声明哪些不可复现;MANIFEST.sha256固定每个文件内容。 - 数据合规:RCA100 与 AIOps2025 数据集仅限非商业使用、答案键明确禁止再分发 → 脚本改为从原始来源下载,无任何结果依赖私有数据。
- 看点:这是"AI 科研可信度"的方法论样板:可追溯台账 + 预先固定的量表 + 无标签裁决 + 明确的"不可复现清单"。做自己的 LLM 评测时可直接抄这套结构。
- 🔗 打开原文
本文摘自《每日前沿研究简报 · 2026-09-11》「七、AI 科研智能体 / AI 科学家:可核查性、主动推断与团队协作」。本内容仅用于研究信息整理与科普交流,不构成医疗建议。

发表评论 取消回复