蚂蚁灵波引领行业创新,发布LingBot-VA 2.0动作模型
2026年7月10日,蚂蚁灵波宣布推出行业首个具身原生世界动作模型——LingBot-VA 2.0。此次发布的模型标志着机器人基础模型的重大转变,即从基于数字世界模型的构建转向面向物理世界的原生设计。这一转变代表了具身智能发展的关键步骤,机器人的“大脑”将不再依赖于数字世界模型的辅助,而是从动态建模、因果预测和实时执行等与环境交互的原始需求出发进行设计。
LingBot-VA 2.0凭借其具身原生架构,在真机测试中展现出卓越的执行速度和泛化能力。视频中,机器人无需任何外部设备即可完成与人类的多轮随机对打。
今年来,世界模型与具身智能的融合一直受到业界的广泛关注。LingBot-VA 2.0从物理世界的控制执行需求出发,强调持续符合因果规律的预测能力。机器人需要面对不断变化的真实世界,不仅要对当前情况做出反应,还要理解动作如何影响环境,并据此决定下一步行动。
LingBot-VA 2.0直面行业挑战,选择了一条更为艰难的道路——基于自回归架构从头开始预训练,并通过四大核心设计构建原生基模。模型引入了语义视觉-动作分词器作为新的视觉编码器,加强了模型在视觉压缩过程中的语义和动作信息对齐,从而提高了指令跟随和动作精度。此外,模型采用严格的因果预训练范式,确保视觉预测和动作生成遵循单向时间顺序。
LingBot-VA 2.0还引入了MoE架构,在保持推理效率的同时扩大了模型容量,实现了性能与效率的平衡。通过增强的异步推理机制,模型实现了实时闭环控制,允许机器人在执行动作的同时预测未来状态,并利用最新观测数据不断校正决策。
蚂蚁灵波CEO朱兴表示,公司将继续探索具身智能的新上限,并加速构建开放的技术生态和场景生态,推动机器人产业的发展。
蚂蚁灵波将于7月17日至20日在2026世界人工智能大会(WAIC)全面展示全栈大脑2.0落地场景的能力,观众可前往上海世博展览馆进行现场体验。