
阿里联合中国人民大学高瓴人工智能学院,今天甩出了一个叫LOGOS的科学大模型,直接开源。这玩意儿最炸裂的点是:它只有1B参数,也就是10亿个参数,但在好几个核心科学任务上,居然打赢了微软那个56B参数的NatureLM——对方参数是它的56倍。换句话说,你拿一辆小排量汽车,跑赢了人家的改装跑车。
怎么做到的?秘密在于“统一语法”。以前科学界做研究,研究蛋白质用一个模型,研究小分子又得换一个,研究两者怎么结合还得再换——每个模型就像不同的外语,科学家得学三四种“语言”。LOGOS干了件狠事:它把所有科学对象——蛋白质、小分子、化学实体、界面互作等7类东西,全部翻译成同一种“离散Token序列”。就像把英语、中文、法语都统一成一种拼音文字,大模型只要学会读这种序列,就能同时理解所有科学对象。
更绝的是,它还能靠“文字描述”脑补出三维结构。以前要分析蛋白质和药物分子怎么结合,得输入复杂的3D坐标,现在LOGOS光靠预测序列,就能在脑袋里画出空间互作规律,连坐标都不用给。这相当于让一个只看过小说的人,凭空想象出电影画面。
传统科研建模还有个老大难:预训练数据是海量序列,但到了具体任务,还得微调一堆参数,就像学了一肚子理论,到现场还得重新培训。LOGOS直接把预训练和下游任务的形式搞成一样——都是序列输入、序列输出,连适配层都不用加,训练完就能直接用。阿里说,模型权重、推理代码和技术报告全开源了,想用直接下载。