BigMixSolDB:用 LLM 从 PDF 抽取混合溶剂溶解度数据库(带不确定性量化)

人工智能 2026-09-12 15 阅读

ChemRxiv · 2026-09-09 · 预印本 · Voinea A 等

  • 问题:化学文献中大量物理数据分散在非结构化文本与复杂表格里;将其转为机器可读格式是训练数据驱动化学模型的前提。但计算抽取的数据集普遍缺乏不确定性量化,导致人工抽取与整理仍不可省。
  • 方案:一个完全自动化、带不确定性量化的抽取流水线 —— 用 LLM 直接从科学 PDF 中抽取复杂表格与文本化学数据,并系统评估多种现代 LLM 与"文档转文本"框架。
  • 验证方式:把计算抽取的数据库与大型人工整理溶解度数据库对比,以基准化抽取不确定性。
  • 结果:流水线捕获了文献所含数据的 93%–79%;对结构匹配行中位对数偏差接近于零,残余高量级偏差集中于难例。
  • 看点:关键创新是"不确定性量化" —— 大多数 LLM 抽取工作只报告"抽对了几成",而这篇把偏差分布当作一等公民,这正是让数据库能被下游模型信任的前提。⚠️ 预印本,未经同行评审。
  • 🔗 打开原文


本文摘自《每日前沿研究简报 · 2026-09-12》「七、AI 科研智能体 / AI 科学家:小模型智能体与能力边界」。本内容仅用于研究信息整理与科普交流,不构成医疗建议

评论 共 0 条

暂无评论

微信小程序

微信扫一扫体验

立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部