本文解析极佳视界GigaBrain-0.7具身基础模型,详解“数据+算法”双金字塔架构及System-3世界模型创新,展示其如何实现超20分钟长程任务连续执行及全面领先的真机性能。
机器人学干活,算法重要还是数据重要?极佳视界发布的新一代具身基础模型GigaBrain-0.7给出了答案。通过构建“数据金字塔”与“算法金字塔”,该模型不仅在理论层面确立了可扩展的具身智能范式,更在真机实测中实现了超20分钟长程复杂操作的一镜到底,全面领先全球头部开源模型。

一、双金字塔体系与核心亮点
极佳视界发布的GigaBrain-0.7具身基础模型,通过构建“数据金字塔”与“算法金字塔”的双轮驱动战略,重新定义了具身智能的扩展范式。这一体系不仅解决了单一维度优化带来的性能瓶颈,更实现了从理论到真机落地的闭环验证。
其核心突破在于首次提出 System-3 概念,将世界模型深度融入实时决策回路,使机器人具备了类似人类高阶思维的预测与规划能力。同时,该模型实现了“One Model, Many Tasks”的开箱即用特性,大幅降低了多任务场景下的部署门槛。
在性能表现上,GigaBrain-0.7在Maker H01真机及RoboColiseum仿真平台的横向评测中均位列第一。最具行业意义的是,它打破了长程执行的记录,首次实现了超20分钟、包含超10个子任务的复杂操作一镜到底。这种连续执行的稳定性,标志着具身智能在长时间自主作业上取得了实质性进展,为后续深入解析其三层算法架构奠定了坚实基础。
二、三层算法金字塔架构详解
基于前述双金字塔体系的宏观框架,GigaBrain-0.7的算法核心在于构建了一套分层的认知协同机制。这种设计并非简单的模块堆叠,而是通过System-2(VLM)、System-3(World Model)与System-1(MoT+Flow Matching)的紧密耦合,模拟人类“思考-预测-执行”的认知闭环。
在顶层的世界模拟(World Simulation)阶段,模型引入了原生时空交互注意力机制(Temporal-Spatial Block)。这一机制通过相对位置与时间编码,有效解决了传统模型在处理长时序任务时的推理断裂问题。更关键的创新在于System-3的介入,它基于GigaWorld-1同步生成动作未来价值评估(Action Value Feedback)及未来关键进展的视觉预测。这意味着机器人在执行动作前,已能在内部“预演”后果,从而大幅提升了长程规划的准确性。
底层则依托于System-1的动作对齐(Action Alignment)层,利用MoT架构与Flow Matching技术,将高层的语义规划转化为高精度的电机控制指令。这种从宏观意图到微观动作的平滑映射,确保了机器人在复杂环境下的精细操作成功率,真正实现了长程任务中的稳定执行。
三、五层数据金字塔工程化落地
算法的高效运转离不开高质量数据的滋养。GigaBrain-0.7构建了五层数据金字塔,旨在解决具身智能中数据稀疏与分布偏差的核心痛点。底座依托近3亿对“图像-语言”数据集及数万小时视频,夯实了System-2的空间理解与System-3的预测基础。在此之上,极佳视界自研了与Maker H01传感器同构的UMI(手柄示教)与EGO(第一视角头戴)设备,从源头保证数据与真机环境的严格对齐。
经过全流程质量闭环清洗,团队最终沉淀出近11200小时的高保真真人数据。这种数据效率极具颠覆性:仅需300条UMI数据进行后训练,即可让Maker H01在全新任务中实现自主操作,极大降低了具身智能的落地门槛。此外,通过引入仿真数据补充长尾场景,进一步提升了模型在复杂环境下的泛化能力,为后续真机性能验证奠定了坚实的数据基石。
四、真机性能验证与Scaling Laws
数据基石铺设完毕,最终成效需由真机实测来检验。实验数据显示,GigaBrain-0.7深刻验证了具身智能领域的Scaling Laws:随着预训练数据量的提升,模型过拟合现象显著缓解,并涌现出更强的泛化能力。特别值得注意的是,增加UMI和EGO数据能直接提升真机执行效果,这证实了无本体数据同样具备可扩展性,为行业提供了新的数据增强思路。
在基模能力方面,得益于全量数据预训练,GigaBrain-0.7展现了惊人的“零微调”潜力,无须针对单任务进行后训练微调,即可实现多任务100%成功率。引入System-3世界模型后,相比传统VLA架构,其在执行任务的成功率、完成得分及速度上均有显著提升。在AgileX PiPER和Maker H01上的评测中,该模型在语言跟随及复杂操作等维度均表现出全面领先优势,真正实现了从理论范式到工程落地的跨越。