蚂蚁百灵发布原生多模态模型Ling-3.0-flash-VL并开源

AI 驱动中国 陆离 74次阅读
分享 Q
AI摘要
由 AI 生成 · 仅供参考

蚂蚁集团百灵系列首个原生多模态模型Ling-3.0-flash-VL正式发布并开源,引入视觉反馈闭环机制,提升多模态理解与生成能力。

驱动中国9月9日消息,蚂蚁集团旗下百灵大模型系列迎来重要进展,其首个原生多模态模型Ling-3.0-flash-VL正式对外发布并同步开源。该模型的最大亮点在于引入视觉反馈闭环机制,标志着蚂蚁在端侧与云端协同的多模态推理路径上迈出关键一步。

Ling-3.0-flash-VL并非在既有文本模型基础上简单叠加视觉编码器,而是从架构层面直接以多模态输入输出为设计目标。据官方技术说明,模型在训练阶段即采用图文交错数据,使视觉与语言表征在共享空间中对齐,从而在图像描述、视觉问答、文档理解等任务上表现出更强的语义一致性。相较此前百灵系列依赖外部视觉模块的方案,原生多模态设计显著降低了推理延迟与参数冗余。

视觉反馈闭环机制是本次开源的核心创新点。该机制允许模型在生成文本或回答问题时,将中间视觉特征重新注入解码过程,形成“看—想—再看—再答”的迭代链路。这一设计使模型在面对复杂图表、模糊图像或多物体场景时,能够主动修正早期视觉理解的偏差,提升最终输出的准确率。蚂蚁方面表示,该机制在多项公开基准测试中,将细粒度视觉问答的准确率提升了约8%至12%,具体数值因任务类型而异。

从参数规模看,Ling-3.0-flash-VL定位为轻量高效模型,适配手机、智能终端等资源受限场景。蚂蚁强调,模型在保持低显存占用的同时,支持高分辨率图像输入与流式输出,可满足实时交互需求。开源版本涵盖模型权重、推理代码及微调脚本,开发者可基于自有数据快速适配行业应用,如电商商品识别、医疗影像初筛、教育场景图文解析等。

此次开源延续了蚂蚁在AI基础设施上的开放策略。此前百灵系列已开源多个文本模型,累计下载量在主流模型社区位居前列。Ling-3.0-flash-VL的发布,进一步补齐了蚂蚁在多模态方向的开源版图。行业分析人士指出,视觉反馈闭环机制为多模态模型提供了一种低成本纠错路径,或将对具身智能、自动驾驶等需要实时视觉理解的领域产生示范效应。

值得注意的是,该模型采用Apache 2.0协议开源,允许商用与二次开发。蚂蚁在技术博客中同时公布了模型在OCR、图表推理、多轮视觉对话等场景的评测样例,显示其在中文场景下的表现优于同量级国际开源模型。不过,官方也坦承模型在极端光照、遮挡严重的图像上仍有局限,后续将通过数据增强与强化学习持续迭代。

随着Ling-3.0-flash-VL的落地,蚂蚁百灵系列已形成覆盖文本、多模态、端侧推理的完整产品矩阵。业界普遍认为,开源生态的竞争正从单一模型性能转向工具链与场景适配能力,蚂蚁此次选择在轻量级多模态赛道发力,既避开了与超大参数模型的正面交锋,又精准卡位了AI应用落地的关键环节。未来,该模型能否在开发者社区形成规模效应,将取决于其与蚂蚁云、支付宝等业务场景的协同深度。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 成为第一个评分的人
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友