Auditing the Auditor:无标签、可校准地测量 LLM 诊断中的"无依据断言"
arXiv:2606.29193 · AAAI Fall Symposium (ATRACC 2026) · 2026-09-09 · 预印本 提出 Telemetry Claim Adjudicator(TCA) :一种"机制式、无需结果
arXiv:2606.29193 · AAAI Fall Symposium (ATRACC 2026) · 2026-09-09 · 预印本 提出 Telemetry Claim Adjudicator(TCA) :一种"机制式、无需结果
Nature Communications · 2026-09-08 · 期刊论文(Karl Friston 等) 论文处理的是"采样哪些结果能最大程度揭示世界模型结构"这一问题,为 结构学习(尤其是规则发现) 提供了原则性方法:在主动推断
Brazilian Journal of Health Aromatherapy and Essential Oil · 2026-09-08 · 综述 综述药物研发管线中计算技术的演进:从早期专家系统(DENDRAL)、计算机辅助药物设计
Human Factors · 2026-09-08 · 期刊论文 比较人–人团队与人–AI 团队在协作决策中的表现,考察信息询问(information inquiry)与团队表现预期如何影响团队过程与结果。 看点 :AI 科研不只发生在
arXiv:2609.05079 · 2026-09-04 · 预印本 40 个来自同行评审研究的盲任务(跨 10 个学科),只给目标与冻结数据、隐藏结论与路径;LLM 评委按 6 维证据成熟度打分。结果:4 个主流编码智能体挤在 58–6
arXiv:2609.02749 · 2026-09-02 · 预印本 DisCo 智能体把开源生态的领域"操作知识"蒸馏为紧凑、可复用的验证技能,产出 AREX-Skill Library(5000+ 技能)。 看点 :这与本站"技能库"
Dr. Claw (arXiv:2609.00365,2026-08-31):以人机协同 + 持久状态 + 技能库把规划-执行-写作变成一条可恢复、可审计的闭环,比裸 CLI 智能体完整度更高。 BloClaw (AI4S 工作站,2026