9月4日消息,瑞典于默奥大学(Umeå University)化学系团队在《化学毒理学研究》(Chemical Research in Toxicology)发表研究,评估了用AI读取专利文件中的化学结构图像、构建有害化学品早期预警系统(EWS)的可行性,结果显示现有工具在真实专利文档上的可靠性参差不齐。
专利不仅是知识产权文件,更是化学品开发信息的庞大来源——一种新分子可能在其规模化生产前数年就出现在专利图中。监管部门若能及早解析这些结构,就能在化学品成为健康与环境威胁前启动评估。但难点在于:专利中的分子结构与反应方案大多以图像形式嵌入,文本搜索无法读取。研究检查的专利中只有不到7%含有化学结构图像,而一旦含有,这些结构对计算机而言基本不可见,除非转换为机器可读格式。
研究团队测试了三种广泛使用的化学结构识别工具,数据集来自欧洲专利局Espacenet数据库:一个通用有机化学集和一个PFAS(全氟烷基物质)集,AI生成结果由五位化学专家验证。
结果两极分化:在标准、绘制规范的有机结构上,三种工具准确率约74%-78%,能正确解读芳环、常见官能团和标准缩写;但在PFAS数据集上表现急剧下滑——43个独立PFAS结构中,26个没有任何一款工具给出正确结果。老旧专利中的模糊、变形图像也会导致误读。
博士生Farina Tariq指出,AI误读分子结构意味着后续一切都建立在错误信息之上——错误结构可能触发不必要的风险控制,或让真正危险的化学品漏网。因此质量控制与置信度评分必须内置于任何自动化工作流。合著者Patrik Andersson教授强调,研究的结论不是该技术明天就能上线,而是首次给出了这些工具在真实专利上成败边界的现实图景——这正是自动化专利筛查未来强化有害化学品早期预警前所必需的。对化学品监管机构(如EPA的TSCA新化学品项目、欧盟REACH)而言,这项研究为把专利文献纳入监管数据源的AI管线提供了基准参照。
(来源:Phys.org)