广告
加载中

从视频到世界模型 生数科技在造具身智能的通用大脑

许一心 2026-09-09 09:55
许一心 2026/09/09 09:55

邦小白快读

EN
全文速览

本文主要介绍了世界模型赛道的发展现状,以及国内头部创业公司生数科技的技术路线和实践成果

1. 目前2026年被业内称为世界模型元年,AI行业正发生路线迁移,从大语言模型转向世界模型,核心目标是让机器真正理解物理世界,把握住AI下一阶段的发展入口,当前行业没有统一标准,多条技术路线并存,竞争激烈

2. 生数科技是国内该赛道走在前列的创业公司,核心优势是打造了数字生成和物理行动互相促进的闭环,从视频生成切入布局具身智能,已经跑通C端视频生成业务Vidu,上线二十天用户破百万,百天破千万,累计生成视频超1亿条,近期拿到近20亿元B轮融资

3. 业内判断,零样本泛化会在两三年内变得明显,具身智能真正落地还需要大约五年时间,当前整个赛道还处于技术探索的早期阶段

本文梳理了世界模型赛道的发展趋势和生数科技的商业实践,能帮助品牌商把握AI产业动向,提前布局新消费场景

1. 当前AI产业的核心发展趋势是从只能处理语言的大模型,转向能理解物理世界的世界模型和具身智能,资本已经大规模涌入,2026年被称为世界模型元年,真正落地预计还需要五年,未来会诞生大量新的AI应用和消费场景,品牌商可提前关注布局

2. 生数科技的C端视频生成产品Vidu已经验证了市场需求,其核心优势是中文提示词理解好、多主体一致性强、性价比高,符合国内C端用户需求,品牌商做AI营销内容生成可参考该方向,匹配用户需求优化产品体验

3. 世界模型最终会落地到实体机器人领域,未来会改变用户的交互和消费习惯,品牌商可持续跟踪技术迭代,提前把握用户行为变化带来的品牌营销和新产品机会

本文梳理了世界模型和具身智能赛道的最新发展,能给AI相关领域的卖家提供市场机会、风险提示和可参考的创业经验

1. 当前世界模型是AI行业公认的下一个核心增长点,资本以十亿百亿的规模涌入,从国际巨头到国内创业公司都在集体布局,C端AI视频生成已经验证了旺盛的市场需求,生数科技Vidu上线百天用户破千万,可见该领域增长空间极大,是值得关注的增量市场

2. 当前赛道仍处于早期,行业没有统一技术标准,不同路线存在分歧,具身智能真正落地还需要五年,需要大量算力、数据投入,进入门槛高,盲目跟风的风险较大

3. 生数科技先做可落地的视频业务反哺长期技术研发,坚持沉淀核心竞争力避免被巨头替代的发展模式,对中小AI卖家有很高参考价值,提示卖家不要走短期取巧路线,沉淀核心能力才能建立护城河

本文介绍了世界模型和具身智能的产业发展,能给工厂的数字化转型、新产品开发提供方向参考和商业机会

1. 当前AI行业正在向连接数字世界与物理世界的具身智能方向发展,最终会大规模落地到工业机器人、服务机器人等实体制造领域,业内预计五年左右逐步落地,提前布局智能化改造、对接具身智能技术的工厂会获得先发的商业机会

2. 具身智能机器人对硬件生产提出了新的需求,模型需要端侧部署,对硬件的算力、延迟控制都有更高要求,同时不同功能的机器人本体都需要适配AI模型,给工厂的产品设计和生产带来了新的需求方向

3. 工厂数字化智能化转型也可参考生数科技的发展思路,先布局可落地的数字化项目获得收入反哺长期研发,逐步积累数据和技术经验,不要盲目追求一步到位,慢慢迭代更容易建立核心竞争力

本文梳理了世界模型赛道的发展现状和生数科技的实践方案,能给AI相关服务商提供行业趋势、客户痛点和解决方案的参考

1. 当前行业发展趋势明确,世界模型是AI下一代的核心发展方向,核心目标是打造能理解物理世界的通用具身智能,2026年已经成为世界模型元年,资本和精英都大量涌入,行业处于发展早期,增长空间巨大,给服务商带来了很多新的服务机会

2. 当前行业已经暴露了明确的客户痛点:具身智能领域带动作标签的训练数据严重不足,大模型难以在机器人端侧部署,推理延迟会导致动作卡顿,准确的在线延迟估计目前还是未解问题,这些都是服务商可以切入解决的核心方向

3. 生数科技已经探索出不少可行的解决方案,比如用无标签普通视频转化为训练数据解决数据不足问题,用计算和执行并行缓解动作卡顿,用统一架构实现多模态能力协同,这些方案对同行服务商有很高的参考价值

本文介绍了世界模型赛道创业公司的发展需求,能帮助AI平台商把握赛道动向,优化布局方向,规避风险

1. 当前世界模型赛道的创业公司对平台的核心需求非常明确,研发需要大规模低成本的算力支持,长期技术探索需要资本和资源的持续投入,头部创业公司生数科技的B轮融资由阿里云领投,足以看出云平台对AI创业公司的核心支撑作用,创业公司对算力的需求会长期持续增长

2. 世界模型是当前AI赛道的核心风口,大量创业公司在不同路线探索,平台可以提前布局该赛道的招商和投资,重点关注有核心技术沉淀、有落地业务反哺长期研发的团队,可以把握赛道发展的红利

3. 需要注意的是当前赛道还处于早期,技术路线没有收敛,真正落地还需要五年左右,平台布局要注意规避风险,不要盲目追热点,避免对不成熟的项目投入过多资源

本文梳理了世界模型赛道的最新产业动向,提出了行业现存的核心问题,也介绍了创新的创业模式,对相关领域研究者有较高的参考价值

1. 最新产业动向方面,2026年已经成为业内公认的世界模型元年,全球AI顶级精英和大量资本都向该领域聚集,行业整体从大语言模型转向对物理世界的建模,目标是打造能理解、预测、行动的通用具身智能基座。生数科技作为国内先行企业,从视频生成切入,提出了L1到L5的行业分级标准,推出MoT统一架构,在权威评测中取得了领先成绩

2. 行业现存新问题方面,当前全球都没有统一的世界模型定义和标准,技术路线存在明显分歧,还面临训练数据需求极大、带动作标签数据不足、大模型难以端侧部署、推理延迟卡顿等多个待解决的核心问题

3. 商业模式方面,生数科技采用落地视频生成业务反哺具身智能长期研发的模式,解决了长期研发的现金流问题,对AI硬科技创业的商业模式研究有较高参考价值

返回默认

声明:快读内容全程由AI生成,请注意甄别信息。如您发现问题,请发送邮件至 run@ebrun.com 。

我是 品牌商 卖家 工厂 服务商 平台商 研究者 帮我再读一遍。

Quick Summary

This article introduces the current development status of the world model track, as well as the technical roadmap and practical achievements of Shengshu Technology, a leading Chinese startup in this field.

1. The industry generally regards 2026 as the "first year of world models", as the AI industry is undergoing a paradigm shift from large language models to world models. The core goal of this transition is to enable machines to truly understand the physical world and capture the entrance to the next stage of AI development. Currently, there is no unified industry standard, multiple technical routes coexist, and competition is fierce.

2. As a front-runner startup in China's world model track, Shengshu Technology's core advantage lies in its closed-loop system where digital generation and physical interaction reinforce each other. It has built its embodied intelligence布局 starting from video generation, and has already fully validated its consumer-facing video generation business Vidu. The product hit 1 million users 20 days after launch, surpassed 10 million users 100 days after launch, and has powered the generation of over 100 million videos to date. The company recently closed a nearly RMB 2 billion Series B financing round.

3. Industry insiders expect zero-shot generalization capabilities to become prominent within two to three years, while full commercial implementation of embodied intelligence will take approximately five more years. The entire track is still in the early stage of technological exploration.

This article summarizes development trends of the world model track and Shengshu Technology's commercial practices, helping brand owners grasp AI industry trends and prepare布局 for new consumer scenarios in advance.

1. The current core development trend of the AI industry is shifting from large language models that can only process text to world models and embodied intelligence that can understand the physical world. Large-scale capital has already flowed into the track, with 2026 hailed as the first year of world models. Full commercial implementation is expected in five years, and a large number of new AI applications and consumer scenarios will emerge in the future, giving brands room for early布局 and opportunity.

2. Shengshu Technology's consumer product Vidu has already validated market demand. Its core strengths include strong Chinese prompt understanding, high multi-subject consistency, and cost-effectiveness, which well fit the needs of domestic Chinese consumers. Brands developing AI-powered marketing content generation solutions can refer to this approach to optimize product experience based on user needs.

3. World models will eventually be implemented in physical robotics, which will reshape user interaction and consumption habits in the future. Brands can continue tracking technological iterations to capture opportunities for brand marketing and new product development brought by changing user behavior.

This article summarizes the latest developments in the world model and embodied intelligence track, providing insights on market opportunities, risk warnings, and referenceable entrepreneurial experience for sellers in AI-related fields.

1. World models are widely recognized as the next core growth engine of the AI industry, with billions and tens of billions of capital flowing into the space. Global tech giants and domestic startups are all rushing to布局, and consumer-facing AI video generation has already proven strong market demand: Shengshu Technology's Vidu reached 10 million users within 100 days of launch, demonstrating the enormous growth potential of this incremental market worth attention.

2. The track is still in an early stage, with no unified technical standards and divergent views on competing routes. Full implementation of embodied intelligence will take five years, and requires massive investment in computing power and data, resulting in high entry barriers. Blindly following the trend carries significant risk.

3. Shengshu's development model -- first launching a monetizable video business to fund long-term technology R&D, and building core competitiveness to avoid displacement by giants -- offers valuable reference for small and medium-sized AI sellers. It demonstrates that instead of pursuing short-term gains, building core competencies is the only way to establish a sustainable moat.

This article introduces the industrial development of world models and embodied intelligence, providing direction reference and business opportunities for factories' digital transformation and new product development.

1. The current AI industry is developing towards embodied intelligence that connects the digital and physical worlds, and will eventually be large-scale implemented in industrial robots, service robots and other physical manufacturing fields. Industry insiders expect gradual implementation in about five years, and factories that布局 intelligent transformation and connect with embodied intelligence technology in advance will gain first-mover business opportunities.

2. Embodied intelligent robots put forward new requirements for hardware production: models require edge deployment, which imposes higher requirements on hardware computing power and latency control. At the same time, robot bodies with different functions all need to be adapted to AI models, bringing new demand directions for factories' product design and production.

3. For factories' digital and intelligent transformation, Shengshu Technology's development idea is also a good reference:先 launch implementable digital projects to obtain revenue to feed long-term R&D, gradually accumulate data and technical experience, do not blindly pursue one-stop completion, and gradual iteration makes it easier to build core competitiveness.

This article sorts out the development status of the world model track and the practical solutions of Shengshu Technology, providing reference on industry trends, customer pain points and solutions for AI-related service providers.

1. The current industry development trend is clear: world models are the core development direction of next-generation AI, with the core goal of building general embodied intelligence that can understand the physical world. 2026 has become the first year of world models, with large inflows of capital and top talents. The industry is in an early stage of development with huge growth space, bringing many new service opportunities for service providers.

2. Clear customer pain points have already emerged in the industry: there is a severe shortage of training data with action labels in the embodied intelligence field, large models are difficult to deploy on the robot edge, inference latency will cause motion jitter, and accurate online latency estimation is still an unsolved problem. These are all core directions that service providers can enter to solve.

3. Shengshu Technology has explored many feasible solutions, such as converting unlabeled ordinary videos into training data to solve the problem of insufficient data, using parallel computing and execution to alleviate motion jitter, and realizing multi-modal capability collaboration with a unified architecture. These solutions have high reference value for peer service providers.

This article introduces the development needs of startups in the world model track, helping AI platform players grasp track trends, optimize layout directions and avoid risks.

1. Currently, the core demands of startups in the world model track from platforms are very clear: R&D requires large-scale low-cost computing power support, and long-term technological exploration requires continuous investment of capital and resources. The fact that the Series B financing of leading startup Shengshu Technology was led by Alibaba Cloud is sufficient to show the core supporting role of cloud platforms for AI startups, and the demand for computing power from startups will continue to grow in the long term.

2. World models are the core current hotspot of the AI track, with a large number of startups exploring different routes. Platforms can layout investment and recruitment for this track in advance, focus on teams with core technology precipitation and落地 business that feeds long-term R&D, so as to capture the dividends of track development.

3. It should be noted that the current track is still in the early stage, technical routes have not converged, and real落地 will take about five years. Platforms should pay attention to risk avoidance when布局, do not blindly chase hotspots, and avoid investing too many resources in immature projects.

This article sorts out the latest industrial trends of the world model track, puts forward the core existing problems of the industry, and also introduces the innovative entrepreneurial model, which has high reference value for researchers in related fields.

1. In terms of the latest industrial trends: 2026 has become the industry-recognized first year of world models, the world's top AI elites and a large amount of capital are gathering in this field, and the industry as a whole is shifting from large language models to modeling the physical world, with the goal of building a general embodied intelligence base capable of understanding, predicting and acting. As a pioneering domestic Chinese company, Shengshu Technology started from video generation, proposed an L1 to L5 industry classification standard, launched the unified MoT architecture, and achieved leading results in authoritative evaluations.

2. In terms of existing new industry problems: there is currently no unified definition and standard for world models globally, there are obvious differences in technical routes, and there are still many core unsolved problems such as huge demand for training data, insufficient data with action labels, difficulty of deploying large models on the edge, and inference latency and jitter.

3. In terms of business model: Shengshu Technology uses the落地 video generation business to feed the long-term R&D of embodied intelligence, solving the cash flow problem for long-term R&D, which has high reference value for the research on the business model of hard technology AI startups.

Disclaimer: The "Quick Summary" content is entirely generated by AI. Please exercise discretion when interpreting the information. For issues or corrections, please email run@ebrun.com .

I am a Brand Seller Factory Service Provider Marketplace Seller Researcher Read it again.

2026年被很多人称作世界模型元年。

它出现的频率够高,从硅谷到中国,从7月的世界人工智能大会到8月的世界机器人大会,这个词的热度异乎寻常,资本也在以十亿百亿的规模涌进来。

这个行业里充满争论。原因之一是:至今没有统一的标准。视频生成叫世界模型,环境仿真也叫世界模型,多条技术路线互不相让,连“什么样的模型才配称通用”都没有共识。

但如果连争论都没有,遑论元年?

争论之外,也有企业在特定路线上已经走得相当远,例如国内的生数科技。它的先发优势不只在某项参数,更在于罕见地把“数字世界生成”与“物理世界行动”两端,拧成了一个互相供血的闭环。

01 最有话语权的一批人,为什么集体换了方向

所谓元年,总有些特殊的动向,如果把大牛流向、资本规模和研究节奏摆到一起就会发现,走向世界模型是AI行业内部的一部分精英主动发起的路线迁移,而不只是外部炒出来的风口。

他们赌的是同一件事:谁能让机器真正理解物理世界,谁就握住了AI下一程的入口。

最先动身的是杨立昆。这位图灵奖得主、卷积神经网络的奠基人之一,做了十二年Meta首席AI科学家,2025年离开Meta后创办AMI Labs;2026年,AMI Labs完成10.3亿美元融资,投前估值达到35亿美元。他的判断很直接:大语言模型无法真正模拟和预测物理交互。

几乎同时,李飞飞的World Labs累计融资超过12亿美元,估值升至50亿美元级别,先后推出Marble与World API。巨头也没缺席:英伟达的Cosmos持续开源,谷歌的Genie迭代到可以实时交互,大家都在喊从“预测下一个词”转向“预测世界的下一状态”。

说到底,这次转向的动因不是概念热度,而是大语言模型在物理世界的边界已经被摸到。它的确压缩了语言,可时间、空间、物理因果和动作这些语言之外的东西,它装不下。

而恰恰是这部分,构成了连接数字世界与物理世界的那把钥匙。钥匙打开的那扇大门背后,是所有人都觊觎的物理AI世界。

02 世界模型要压缩什么,又靠什么证明自己

语言之外还有什么需要被压缩,恰恰是理解世界模型的入口。

生数科技世界模型执行负责人王泽远的答案,从一句行业老话讲起——压缩即智能。

王泽远解释得更朴素。对物理世界的建模可以细到原子、电子层面的运动;但人生活在宏观世界,用不着追踪每一步里所有微观粒子的变动,很多东西因此可以被压缩掉。

也就是说,世界模型是在找一个最优的压缩方案,压缩对象随之拓展到语言之外的时间、空间、物理因果与动作,不再只答“是什么”,还要答“会产生什么后果”。

但压缩只是起点。更关键的是三项能力如何拧成一体。生数科技创始人兼首席科学家、ACM/IEEE/AAAI Fellow朱军在世界机器人大会上说得很明确:“我们希望构建的,不只是服务于某个任务或场景的专用模型,而是一个能够理解世界、预测未来并采取行动的通用基座模型。”

“通用世界模型不是单一的生成器、模拟器、机器人动作模型或策略模型,也不是这些能力的割裂片段或简单线性串联,而是三种能力耦合在一起的闭环反馈系统,”朱军说。

闭环两个字是重点。行动不只是模型吐出来的结果,它会改变环境、产生新信息,再回流成下一轮的理解与预测。朱军打过一个比方:人学骑车,一开始歪歪扭扭,后来稳了,变的不是肌肉,是脑子里那个“车会怎么倒”的内部模型——摔一次,它更新一次。

至于如何理解和构建世界模型,讨论还远未收敛。李飞飞用渲染器、模拟器、规划器来梳理世界模型的功能;在实现路径上,杨立昆走的是JEPA,生数则从视频生成切入。

其中一个核心分歧是:让AI理解物理世界,一定要显式生成画面吗?

这要看下游任务。据王泽远解释,只做具身其实不用预测那么细——别人每根头发丝怎么动,对执行任务没帮助;但影视制作、游戏渲染就很看重这些。

我问王泽远,视频生成对创业公司是条更重的路,需要堆算力。而杨立昆明确提过,他那套不需要堆砌大量算力。为什么还选重的?

他给的答案很实在:对一家创业公司来说,不光要最小化消耗,更要最小化风险。

谈到杨立昆的技术路线,他并未回避其中的分歧,但最终给出了明确认同。人在脑子里想事情,并不会像素级地重建画面——你想象自家大门,只会想个轮廓,不记得门上每道纹理。在省算力这点上,他直言很支持这种思路。

问题在于成熟度:这条路线目前还很不成熟,要填的算力坑,可能远比视频模型大得多。他仍看好它的潜力,只是觉得需要时间沉淀。

路线尚未收敛,比较也需要坐标。生数在世界机器人大会上提出L1到L5的分级路线,把自己现阶段的实践对应到前三级。词被用滥时,谁先立标准,往往就说明谁跑在前面。

对生数而言,分级是在外部建立坐标,统一架构则是在内部打基础:让理解、预测与行动尽早协同起来,为下一阶段的能力演进积累条件。

03 统一大脑,从视频里长出行动

生数绝不是追逐世界模型的公司里面体量最大、精英人数最多的那个。它值得关注的地方,在于如何把视频与具身两端接起来。而那个互相供血的闭环,具体是怎么搭起来的?下面一项一项说。

起点在2022年9月:团队提出U-ViT架构,比OpenAI的DiT还早三个月,核心成员出自清华人工智能研究院——一上来切入的就是基座模型,而非应用层。

生数对数据的理解也与众不同:视频是数字与物理世界之间最便于规模化共用的数据格式(图像、语言、音频、3D等同样可以共用),只是视频在信息密度与可得规模上都更占优势——机器人采集轨迹时挂着相机,拍的是视频;互联网上的海量素材也是视频,格式相同,只是一个有动作标签、一个没有。

具身智能最大的痛点,是有动作标签的数据太少。生数的独到之处,是用生成式方法把海量无动作标签的普通视频,变成能训练机器人的“物理世界燃料”。这正是双轨闭环的第一块基石。

这套数据思路,落实到训练上主要分四步:先用互联网视频训出视频基座;再用无动作标签的第一人称数据预训练,建立任务感知与本体认知;然后用带动作标签的真机数据训练动作分支;最后在特定机器人和任务上做后训练。

第一人称数据没有动作标签,怎么训练动作?靠估——用单目深度模型加SLAM(同步定位与建图)估出手部位置。据介绍,估得越准,模型能学到的动作线索也越准。

架构上,生数拿出的是全球首个MoT统一架构,把环境理解、状态预测、动作生成纳入同一个框架,而非几个模块各干各的。最见功力处,是同一个模型能自由切换输出:对创作者吐像素级视频,对机器人吐可执行动作。

数据可以共用之后,下一个问题是:不同模态之间,怎样真正交换信息?

聊到这里,出现了采访中最有意思的一处分野。标准说法是,MoT把“理解专家、生成专家、行动专家”统一在一个模型里。我据此提问:三个专家怎么对齐、怎么防止打架。

王泽远却把前提往回拉了一步:这三者是模型具备的能力,并不是架构本身。

真正的MoT,分的是三个模态流——视频、动作和语言。

这不是咬文嚼字:能力是模型对外能干什么,架构是内部真实的组织方式。朱军在世界机器人大会上的表述其实已是如此——为不同模态配专属参数,用共享注意力完成跨模态交互。

所以“用视频教会机器人动作”,不是让机器人先看一段生成视频再照做,而是在训练时,让视频那一侧的学习成果通过联合训练帮助动作那一侧。

这也解释了它与典型VLA路线的区别。VLA(视觉语言动作模型)过去两年是主流做法,主要从观测和指令直接学习动作映射;Motubrain进一步把世界状态变化与动作生成纳入统一建模框架,让模型在生成动作的同时学习“动作会如何改变世界”。

从“反应”多走一步,走向“预见”,是它提高长程任务成功率的思路。

发布会上有个演示很出圈:机器人用漏勺捞丸子,捞空了,自己又捞一次。代码里没写重试逻辑。它怎么知道自己没捞到?

据王泽远解释,机器人不是靠预测下一帧发现自己没捞到,而是在动手那一刻,脑子里已经同时备好了两套后续动作——捞到怎么走、没捞到怎么走。所以无论结果如何,接下来都能衔接。

这些能力,最终还要放到评测中验证。在专测机器人执行能力的RoboTwin 2.0上,Motubrain拿下双场景第一,是唯一在随机环境(打乱光照、位置、干扰物,考的是应变)里平均分仍站上95的模型。

比榜单更贴近落地的是真机泛化。只用五十到一百条同本体样本,就能适配一台新人形机器人。演示中,全程不借助上层规划:插花插到一半被打断能接着完成;左右手异步,倒水的倒水、拿面包的拿面包;水一满,就自动判定任务结束。

适配数据还能不能继续往下压?王泽远认为,下限至少也得有一条,零条并不现实。他打趣说,就算自己和同事换个身体,也得花点时间适应。

当然,从榜单高分到真机上不卡顿,中间还隔着一层工程活儿——这恰是最难被抄走的部分。

世界动作模型每次推理要生成一段动作序列,计算需要时间;等一段执行完再算下一段,机器人就会在动作边界卡顿。解法是提前算、让计算与执行并行,但新旧两段基于不同时刻的观测,衔接处又可能打架。

生数为此试用了六种策略,公开的总结写得相当老实,尤其承认局限的部分:准确的在线延迟估计“目前仍是未解问题”;一旦出现突发障碍物,前缀约束反而会成为干扰。

这也是视频与具身两端能够共享工程经验的地方。两端对实时性的要求虽然不同,但底层都指向同一个问题:如何让大规模生成模型在连续交互中足够快。Vidu S1已经将视频生成推进到最高42 FPS;在机器人一侧,Motubrain完整模型运行频率约5 Hz,Video-to-Action模式最高可达11 Hz。

但打通这个闭环并非没有代价。机器人要考虑端侧部署,尽量让模型跑在本体上,否则延迟和网络都是麻烦;生数同时又想探究智能上限,那意味着加数据、加参数——两件事撞在一起了。

但是,模型一旦大到接近主流视频大模型的那个量级,就几乎没法在机器人上做端侧部署;即便勉强部署,成本也未必划算。

所以生数现阶段的取舍很清楚:先把智能做出来。在具身方向,探索技术上限的分量,明显重过马上规模化商业部署。

这条规模效应的曲线走到哪了?其实,还在非常早期。

要够到大语言模型今天的程度,王泽远认为至少要千万乃至上亿小时的视频——一亿小时,相当于一万多年不间断的画面。

这么大的数据需求,能不能靠仿真补上?他的态度更干脆:“sim2real gap确实还没解决,所以我不用仿真数据。”

04 定价

具身还需要时间,生数却并非在零收入的状态下等待。视频业务已经为这场长期探索提供了现实支撑。

这里得先说清楚Vidu是什么。它是2024年5月生数科技发布的视频生成大模型,也是中国第一个公开发布、对标Sora的同类产品,用的正是前面那套U-ViT架构。

全球上线后,它二十天用户破百万、百天破千万,平台累计生成的视频早已过亿;对中文提示词的理解、多主体一致性、性价比是它的长板。

这门已经跑通的生意,让生数向物理世界延伸时,手里既有技术积累,也有商业基础。视频与具身的联系,由此从数据和架构延伸到了公司的长期投入能力。

在这个底子上,今年2月,生数完成超过6亿元的A+轮;两个月后,近20亿元的B轮由阿里云领投。这样密集的节奏本身,就是资本对它技术路线的连续定价。

不过,资本给的是远期定价,而技术负责人给出的时间表并不激进:两三年内,零样本泛化的趋势会变得非常明显,真正谈具身落地,大约还要五年。一头是当下的重金下注,一头是五年的耐心——这落差本身,就是这条赛道最真实的写照。

05 结语

生数把视频当成通往物理世界的主要可规模化入口,用统一架构连接数字世界的生成与物理世界的行动,并抢先把这条路写成从L1到L5的刻度。它正在做的,是把行业还在争论的问题,先做成可被检验的事实。

当然,这条路上生数并不孤独——英伟达、李飞飞、杨立昆都在做,国内也有若干家路线相近的公司。区别不在于有没有人同行,而在于走到了哪一步,以及有多少东西经得起第三方验证。

采访快结束时,我给王泽远讲了个流传很广的故事。

一家香皂厂的流水线偶尔漏装,盒子出来是空的。企业招来博士后带十几个人,上摄像头、计算机、机械臂,搭了整套视觉分拣系统;另一家乡镇企业,只在出口放了一台大功率风扇——盒子里没香皂、太轻,直接被吹走。

这故事通常用来嘲笑前者用高射炮打蚊子。但我们这里讲的是更深的一层:风扇只解决了那一个场景,什么也没沉淀;那套看似笨重的视觉系统,留下的是一整套可复用的经验。

做基础设施、追求技术上限,本质是选择做重的、难的、苦的事。前提是,这些投入最终能够沉淀为核心竞争力。对这一点生数毫不含糊:不获得核心竞争力,巨头很容易取代你。

取巧没有护城河:取巧谁都会,而巨头取巧的成本比你低得多。

我请王泽远用三四句话概括生数最核心的竞争力。他想都没想:“生数就是一家信奉规模效应的公司,我们不是为了短期利益,是为了长期,这句话就够了。”

备注:本文数据主要取材于生数科技提供的相关网页报道,以及采访和提纲沟通中的数据,其余第三方数据很少。

注:文/许一心,文章来源:创业最前线(公众号ID:chuangyezuiqianxian),本文为作者独立观点,不代表亿邦动力立场。

文章来源:创业最前线

广告
微信
朋友圈

FAQ回顾

世界模型在AI行业的核心价值是什么?

世界模型可对语言之外的时间、空间、物理因果与动作进行建模,不仅能解答“是什么”,还可预测“会产生什么后果”,是连接数字世界与物理世界的核心入口,被视为AI下一阶段的核心发展方向。

生数科技研发的世界模型有什么技术特点?

生数科技从视频生成切入研发世界模型,推出全球首个MoT统一架构,将环境理解、状态预测、动作生成纳入同一框架,可同时支持像素级视频生成和机器人可执行动作输出,构建了数实联动的闭环反馈系统。

生数科技的世界模型在机器人领域表现如何?

生数科技的Motubrain模型在机器人执行能力评测RoboTwin 2.0中拿下双场景第一,是唯一在随机环境下平均分达95的模型,仅需50到100条同本体样本即可适配一台新人形机器人。

目前具身智能大规模落地还需多久?

当前具身智能还处于技术早期阶段,存在训练数据不足、端侧部署成本高、实时性待优化等问题,行业普遍判断零样本泛化趋势将在两三年内显现,距大规模落地还需约5年时间。

这么好看,分享一下?

朋友圈 分享

APP内打开

+1
+1
微信好友 朋友圈 新浪微博 QQ空间
关闭
收藏成功
发送
/140 0