8月25日消息,一篇提交至arXiv的研究(编号2608.24513)由Ivan D. Rubtsov、Vadim V. Korolev等研究者发表,推出名为DOSSIER的化学语言模型,实现仅凭元素组成预测电子态密度(DOS)。

电子态密度通常需要先获得弛豫的晶体结构才能计算,但对于尚未合成或未被编目收录的化合物而言,结构信息并不存在。DOSSIER(Density of States from Stoichiometry with Encoder Representations)直接建立从元素组成到DOS谱的映射。其编码器通过从通用机器学习原子间势进行跨模态知识蒸馏完成预训练——这种迁移在仅有1000个训练样本时即可将预测误差降低11%。

性能方面,在Mat2Spec基准上DOSSIER达到3.76 states/eV的平均绝对误差,与最优结构感知模型的3.64相当;在扩展的Materials Project数据集上,预测谱带隙与d带描述符均达到实用精度。作为应用演示,团队对11,977种二元与13,251种五元高熵合金组成进行了d投影DOS筛选,寻找与电催化经典材料NiPt3相似的电子结构,已知氧还原电催化剂在排序中名列前茅,验证了模型在催化剂高通量筛选中的实用性。

该方法将DOS预测的前置条件从“已知结构”放宽到“已知化学式”,对尚未合成的新材料虚拟筛选意义重大:结合组成空间的海量组合与自动化排序,可大幅扩展电催化剂等功能材料的探索边界,为“先筛组成、再定结构”的逆向设计流程提供工具支撑。 (来源:arXiv)