大火的世界模型配资融资方式,真的不能拿一张消费级显卡跑吗?
有的,家人们,真的有的。
因为就在刚刚,一个国产的、开源的世界模型,做到了!
来,先来看一下第一人称射击效果:
在雪地科幻场景里,角色一边移动和转动视角,一边开火,过程中还能看到爆炸、火焰、能量护盾等反馈。
重点是这些变化都发生在同一个持续生成的世界里,场景也会随着操作继续往前走。
再来看大热的《奥德赛》的场景:
这次是第三人称视角,角色在巨型木马、城墙和火光之间向前探索。随着角色不断移动,近处的人物、地面和远处建筑也在持续展开,整个场景的空间关系基本能一直维持下来。
再换一个完全不同的风格:
三个 Demo,三种完全不同的世界。
而跑出这些效果的,就是蚂蚁灵波在 7 月开源的LingBot-World 2.0。
而刚刚,他们又发布了 LingBot-World 2.0 的轻量版,参数规模只有 1.3B。是面向消费级单卡 GPU 设计、可以在本地实现实时世界生成的那种。
LingBot-World 2.0 在今年 7 月开源的是 14B 主模型。这套世界模型已经能做到小时级持续生成、丰富的动作和事件交互,并在相应算力和推理配置下实现 720p/60fps 的高清实时体验。
彼时," 1.3B "这个数字,就已经悄悄出现在了论文摘要里。

而且就在上周的 IFA 柏林消费电子展开幕演讲上,这个伏笔又被公开点了一次。
在开幕演讲中,AMD 高级副总裁 Jack Huynh 一共点名了 3 个开源模型,除了智谱、千问,就是 LingBot-World。他拿 LingBot-World 2.0 做了 Demo。一个 Prompt 生成世界之后,角色可以在中国小镇、欧洲乡村等环境里长时间探索、环顾和行动,场景还会随着交互继续向前展开。
Jack Huynh 看完之后给了一句评价:
This is the future of Personal AI.

一切的承诺,今天,均已兑现。
但比起又一个开源这个动作来说,我们或许更好奇的是——
能本地实时跑起来的世界模型,到底是怎么做到的?
不只是变小了那么简单
要回答这个问题,得先从世界模型和普通视频生成的区别说起。
平时我们用 AI 生成一段视频,输入 Prompt 之后,等几十秒甚至几分钟都很正常。模型把整段视频生成完,再把结果交到你手里,事情基本就结束了。
但世界模型显然不是这么干的。人在场景里往前走一步,模型就得接着往前生成;视角转向左边,画面也得跟着变化……换句话说,世界模型是在生成一个持续演进的世界。

虽然 7 月的 LingBot-World 2.0 已经把这件事做到了一个相对不错的效果,例如做过超过一小时的不间断生成测试,从水乡、城市一路跑到雪地、太空等不同场景,整个过程中,模型都能维持比较稳定的场景结构和视觉质量。

但这一套体验的背后,工程栈也是相当繁重的。
蚂蚁灵波在部署层面堆了编译器级别的注意力 Kernel 优化、动态 KV 缓存调度、异步流媒体传输,还有混合并行推理策略等……为的是让高质量的实时世界能先跑起来。
于是在今天之前,绝大多数人接触世界模型的方式其实只有两种:看官方放出来的视频,或者去在线 Demo 页面点两下。
所以 1.3B 版本想要解决的问题是,能不能在较少的算力情况下,也把它跑起来。
不过从 14B 到 1.3B,蚂蚁灵波并非是先做出大模型然后再砍小,而是先把一条训练路线走通,小模型是这条路线走到最后自然出现的产物。
为此,蚂蚁灵波团队首先训练了一个叫Causal World的模型。所谓 Causal,可以简单理解成,模型生成当前状态时,只能依赖过去已经发生的视觉信息,以及用户到此刻为止给出的输入,未来还没发生的内容不能提前看,即为因果。
但在这个过程中,自回归模型会把自己刚刚生成出来的结果继续当成后面的输入。前面只要稍微偏一点,这个误差就有可能一路被带到后面。生成时间拉长之后,纹理会变糊,几何结构会逐渐变形,整个场景甚至可能慢慢漂掉。
为了让 Causal Pretrain 阶段的模型在长上下文里保持住生成质量,LingBot-World 2.0 又设计了 MoBA,也就是 Mixture of Bidirectional and Autoregressive Attention Mask。
它主要解决的是纯 Teacher Forcing 在长上下文里容易出现的另一个问题。随着上下文越来越长,模型会越来越依赖前面已经给出的干净 Context,最后容易出现过拟合,视觉质量也会跟着下降。
MoBA 在原有 Teacher Forcing Mask 里加入一部分双向 Attention,相当于给训练过程增加一层正则,让模型适应更灵活的视频长度,同时缓解这种过拟合和画质退化。

这一阶段训练出来的 Backbone,先把世界模型的基础能力撑了起来。
团队后来还专门拿这个 Causal Pretrained Backbone 和 MAGI、HY-World 1.5 做过长时生成对比。从 5 秒到 60 秒,LingBot-World 2.0 在纹理、几何结构和场景连贯性上的保持更加稳定。

但高质量的 Backbone 还有一个很现实的问题:慢。
这个经过因果预训练的 Backbone,同时也承担 Teacher 的角色。Teacher 可以给出质量更高的生成结果,但每一帧都需要经过很多步去噪,如果直接拿去做实时交互,计算成本还是太高。
所以接下来,LingBot-World 2.0 开始做蒸馏。
第一步是一致性蒸馏,也就是 Consistency Distillation。它把 Teacher 原本需要很多步才能走完的去噪轨迹压缩到少数几步,让 Student 用更少的计算完成生成,同时尽量保留预训练阶段已经学到的动作条件动态能力。
不过 Student 真正部署出去以后,面对的大量状态都来自它自己上一轮的生成。前面只要出现偏差,后面还是有可能继续放大。
于是团队又在这一步加入了 DMD,也就是 Distribution Matching Distillation,并且专门让 Student 在自己的长时 self-rollout 轨迹上继续训练。
配资炒股换句话说,模型以后真正会跑进什么状态,训练时就先让它提前见过。这种训练方式可以减少长时自回归过程里的累计漂移。
到这里,整条路线才算真正接了起来。
LingBot-World 2.0 先用 Causal Pretrain 打下一个长时生成相对稳定的世界模型底座,再让 Teacher 提供高质量的生成过程,随后通过蒸馏把原本需要多步完成的计算压缩到少步,最后再让 Student 去适应自己真正运行之后会遇到的状态。
所以从表面看,这次只是又多了一个小尺寸版本。往深一层看,蚂蚁灵波实际上把 LingBot-World 2.0 的研发链路也往外开放了一截。
世界模型的门槛也要被打下来了
若是我们把时间往前倒一点,就不难发现 LingBot-World 这一年的变化几乎一直围绕两个字展开——门槛:
今年 1 月,LingBot-World 1.0 第一次开源;
到了 7 月,LingBot-World 2.0 来到 14B,开始挑战小时级持续生成、复杂事件交互和 720p/60fps 实时体验;
元股证券:ygzq.hk今天,1.3B 版本又把同一套世界模型往消费级单卡上推了一步。
三次开源,依次回答的其实是三个问题:
能不能做出来,能不能做得久、做得真,以及能不能让更多人跑起来。
而这次蚂蚁灵波把 Causal Pretrain 和双向 Teacher 一起放出来,走的也是同一个逻辑。
小模型负责让更多人把世界模型跑起来。这两个上游模型管的是跑起来之后,社区能不能接着往下改,做后训练、做蒸馏、做压缩、做垂直场景适配。
因此,如果说世界模型的上半场,比的是能不能生成得更久、更真;那么下半场要比的,可能是能不能让普通人手上那张卡也跑得动。
这个规律在 AI 发展的过程中其实已经重复过好几回了。真正让一项技术扩散开的,往往不是最强的那个版本,而是第一个足够小、足够便宜、能被拿来试一试的版本。
最后,如果说世界模型一直在尝试把 AI 装进一个可以无限延展的世界里。
那么现在,当门槛被打下去之后,这个世界终于开始装得进普通人的显卡了。
官网:
https://technology.robbyant.com/lingbot-world-v2
模型:
https://huggingface.co/collections/robbyant/lingbot-world-v2
代码:
https://github.com/robbyant/lingbot-world-v2
论文:
https://arxiv.org/pdf/2607.07534
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
� � 点亮星标 � �
科技前沿进展每日见配资融资方式
正配网|正规官方配资门户 - 元股证券提示:本文来自互联网,不代表本网站观点。