蚂蚁 inclusionAI 开源 Ling-3.0-flash-VL,124B MoE 配 262K 上下文,MIT 协议

2026-09-14 开源多模态模型发布

蚂蚁 inclusionAI 放出了 Ling-3.0-flash-VL:在 Ling-3.0-flash 纯文本模型上加了图像和视频理解,124B 总参数、MoE 结构激活只有 5.5B,上下文拉到 262K,MIT 协议。

单看每一项都不新鲜,但三个凑在一起就值得认真看了:可商用的协议、塞得下长文档的上下文、跑得动的激活量。 做过产品的人知道这意味着什么——选模型时最纠结的往往就是这三条永远凑不齐:协议干净的上下文短,上下文长的部署不起,部署得起的法务不让用。

5.5B 的激活量是个很实际的数字。同参数密度的稠密模型做同样的事,显存和延迟都要难看好几倍。这意味着一张消费级或者入门级算力卡就有机会跑起来,不用一上来就租 A100。

如果你在做有「理解图片或长文档」环节的产品,几个直接能想到的落法:

  • 用户反馈截图批量转结构化问题单,不用人看图。
  • 合同、报表、论文整份读入再抽字段,省掉切块拼接的工程量和它带来的上下文损耗。
  • 长视频抽帧建语义索引,做可检索的视频资料库。

有一个提醒:MIT 只解决法律问题,不解决效果问题。你的场景里它到底行不行,还是得拿自己的数据测。开源模型榜单分数和你在脏数据上的表现,经常是两回事。

原文出处 · 事实以此为准
Hugging Face · inclusionai/Ling-3.0-flash-VL
阅读原文 ↗