微信 AI 官方 9 月 4 日宣布,将通用多模态嵌入模型 WeMM-Embedding 开源,包含 2B、4B、9B 三个版本,支持文本、图像、视频、视觉文档以及任意交错的多模态输入。
据微信员工 @ 客村小蒋 分享,微信视觉团队开源的多模态模型 WeMM-Embedding,简单来说就是让系统能同时理解文字、图片和视频,把它们放在同一个语义空间里去比较和检索。

已在朋友圈搜索、视频号推荐等场景落地
他透露,这个模型已经在微信里大规模使用——朋友圈搜索、视频号推荐、公众号推荐、微信电商都在用,每天调用量达 10 亿次。在国际权威榜单 MMEB-v2 上,该模型拿下了第一名,超过此前所有已提交的开源与闭源模型。
目前,WeMM-Embedding 的相关资源已同步开放:论文发布于 arXiv,代码仓库托管在 GitHub 的 Tencent/WeMM-Embedding 项目下,模型集合也已上线 Hugging Face。