
6月18日,阿里联合中国人民大学,正式开源了一款名叫LOGOS的AI模型。这不是普通的实验室玩具——它相当于给科学界发了一套通用语言,蛋白质、小分子、复杂材料这些原本互不相通的研究对象,终于能坐在一起“聊天”了。
过去,科学家想让AI理解不同物质,得给每个对象画3D坐标图,像给机器人写手写体说明书,既费钱又不通用。换一种材料,模型就得重头学。LOGOS干了件聪明事:它发明了一套共享“词表”,把蛋白质、抗体、小分子、MOF材料这些乱七八糟的结构,统统变成一串串像文字一样的离散Token。模型不用再算昂贵的3D空间,而是像读句子一样,靠预测下一个词,就能直接推演出复杂的分子间怎么相互作用。
效果惊人。LOGOS-1B版本,体重只有微软NatureLM的1/56,却在好几个核心科学任务上跑赢了对手。更省心的是,它不用像其他模型那样做复杂的微调,拿过来就能用,科研人员不用再花几个月调参数。
目前,LOGOS已经消化了7类、44.87亿个Token的科学语料。项目组把代码、权重、技术报告全扔到了GitHub和HuggingFace上,谁都能下载。这套“科学语法”一旦跑通,未来搞材料、做药、研究蛋白质的,可能都用同一套AI工具——真正意义上的科研自动化,或许就从这里开始。