
9月4日,微信AI团队宣布,把自家训练的多模态嵌入模型WeMM-Embedding正式开源。这个模型最大的本事,是能同时看懂文字、图片、视频和视觉文档,还能把不同类型的内容放进同一个语义空间里做比较和检索。
听起来有点抽象?换个说法:以前你想搜一张图,系统只能拿文字搜标题或标签;现在有了这个模型,你可以用一段话、一张图甚至一段视频片段,去找到另一段“意思相近”的视频或文章。它像一座桥,把各种格式的内容翻译成同一套“数学语言”,让机器知道它们到底在讲什么事。
别以为这只是个实验室项目。微信员工“客村小蒋”透露,WeMM-Embedding已经在微信里大规模落地了。朋友圈搜索、视频号推荐、公众号推荐、微信电商这些日常功能,背后都有它在跑数据。调用量相当惊人——每天要处理10亿次请求。
模型的能力也经过了国际检验。在基准测试MMEB-v2榜单上,WeMM-Embedding拿到了第一名,超过了此前所有提交结果的开源模型和闭源模型。
目前,微信已经把相关资源全部放出:论文挂在arXiv上,代码在GitHub的Tencent/WeMM-Embedding仓库里,模型权重也上传到了Hugging Face。这次一共开放了三个版本,参数量分别是2B、4B和9B,开发者按需取用就行。
一个每天服务上亿用户的模型,能完整开源出来,并不多见。对整个AI圈来说,这相当于给多模态检索领域打了个样:最好的效果,并不一定非要关起门来用。