核心技术是 VLA(视觉-语言-动作)大模型——把视觉感知、语言理解和动作生成统一在一个模型里,让机器人“听得懂指令、看得见环境、动得了手”。技术栈分五层:感知层、大脑层(大模型任务规划)、小脑层(运动控制)、仿真与数据层、应用编排层。2023 年后爆发质变的原因有三:VLA 成熟度提升(真实机器人任务成功率显著提高,高校研究如视觉锚定策略把真实场景成功率提升一半以上);整机价格下探(主流人形本体进入数万至二十万元区间);仿真数据引擎成熟(可用开源仿真平台低成本生成训练数据,形成“仿真训练—真机部署”闭环)。政策端工信部《人形机器人创新发展指导意见》与“人工智能+”行动也打开了窗口。
收起>