
专题:2025天下机器东说念主大会:AI大模子赋能机器东说念主与具身智能产业新范式换取举止世界杯体育
“2025天下机器东说念主大会”于8月8日至12日在北京经济手艺开发区开幕,“AI大模子赋能机器东说念主与具身智能产业新范式换取举止”算作2025天下机器东说念主大会的专题举止于8月8日同期召开。光轮智能处置决策副总裁张建伟出席并演讲。
以下为演讲实录:
全球下昼好,我是来自光轮智能的张建伟,今天和全球共享的主题是《合成数据加快具身智能插足物理天下》。今寰宇午也听了全球的共享,有作念骨子,有作念模子的,可是全球提到更多的依然数据方面,固然也有作念真确数据相聚的。
咱们作念的相对比拟聚焦,主要在合成数据范围。
我今天的共享聚焦两个点:
第一部分,咱们关于合成数据的瓦解。
第二部分,先容一下咱们在作念的一些事。
领先看AI的发展,咱们不雅察到两个趋势:
一是AI正以多模块的花式往端到端标的发展,包括大说话模子、自动驾驶,也包括具身VLA范围。所谓端到端,即是用更多的神经收罗替代更多模块,比如在自动驾驶范围——我之前也作念智驾这一块——端到端的出现,让咱们看到自动驾驶范围中,之前的感知、展望、蓄意多模块架构,正通过举座的端到端收罗作念替代。具身智能采取VLA的收罗架构,推行上亦然端到端的架构。端到端的出现意味着咱们需要更多高质地数据来升迁AI举座性能。
二是Transformer收罗模子的出现及巨额应用,让咱们看到AI正在往“以数据为中心”的标的发展,数据质地的猛烈决定了AI的性能猛烈。是以在这两个趋势下,咱们不错说今天的AI时间其实是以数据为中心的时间。
回到今天的话题,咱们以为,具身智能的数据需求会是自动驾驶和大说话模子的1000倍。领先,前边也有嘉宾提到具身数据比拟很是,需求量大,因为今天的具身智能但愿机器东说念主能走进千门万户,应用到不同场景,比如工业场景、居家场景、商超场景。不同场景下,需要具身智能有更好的泛化性,这就需要更多更丰富的数据,是以数据需求量会比自动驾驶和大说话模子高三个数目级。
第二,具身数据更强调物理交互。比如大说话模子可能是文本,VLM模子可能是文本+视觉,自动驾驶可能多了激光雷达和毫米波雷达,而具身智能更多讲理与物理天下的交互,包括机器东说念主的通顺轨迹、力的反映,前边也有嘉宾提到力学传感器。推行上咱们但愿具身智能能真确感受物理天下,是以对数据有更强的物理交互条目。
第三,由于具身智能有不同形态——机器狗、东说念主形机器东说念主、机械臂,东说念主形机器东说念主又分轮式、双足等不同形态——具身智能所需的数据自身亦然异构的,很难有结伙标品化的机器东说念主应用到不同场景,因此数据需求亦然异构的。
第四,当今具身智能的数据缺口止境大。不像大说话模子不错从收罗上获得海量数据,自动驾驶不错通过数据相聚车或量产车作念数据闭环来获得海量数据;而具身智能沟通到数据模态的很是性,亟需预测验数据、后测验数据以及强化学习测验数据。
这是具身智能的数据的“数据金字塔”:底层但愿期骗海量互联网数据,推行是让模子对物理天下有基本瓦解;最表层但愿通过真确天下的数据作念微调,让具身算法落地到具体应用场景。真确数据的上风顾名想义是真确,但相聚资本高、效力低。不仅要处置东说念主工遥操问题,还要处置场景搭建及骨子采购或制作问题,因此真确数据的相聚资本很高。
中间一层是合成数据,它的上风是表面上唯有有弥漫多的GPU算力,就不错提供无尽量的数据。由于合成数据在仿真环境下生成,是以泛化才调更强。因此,合成数据不仅能提供足量数据,也能提供高泛化性数据。但合成数据也有问题,存在仿真与真确天下的“DomainGap”。是以若是咱们能通过手艺技能不断收缩合成数据的“DomainGap”,就能赋能具身智能的发展。我以为“Sim2Real”不口角0即1的问题,而是不错通过手艺技能不断收缩各别的问题。
第二点瓦解是,咱们不以为不存在合成数据的“永动机”,AGI的发展需要东说念主类的示范数据。
这少许不错类比大说话模子和自动驾驶:大说话模子如GPT的后测验阶段有不少RLHF数据,这些数据的提供者是OpenAI从各行业找来的众人(比如数学博士、物理学博士、大夫),他们提供高质地语料库,进一步升迁大模子性能;自动驾驶范围,端到端出现后需要“五星司机”的高质地驾驶数据,以升迁自动驾驶算法的类东说念主化才调。因此咱们从大说话模子和自动驾驶中得到启发:它们的发展需要“东说念主在环”提供高质地数据。具身智能咱们以为亦然不异的,包括前边提到的遥操相聚数据,不管是在真确天下依然仿真中相聚,推行上齐需要有东说念主在环示范。比如咱们会示范怎样教具身智能叠穿着、炒菜或作念具体任务,这些数据其实开头于东说念主的示范。
举座上咱们以为,具身智能的合成数据需要“东说念主在环”的高质地示范,伙同仿真环境的才调,提供更泛化的数据,以此放大东说念主类操作数据的价值。
接下来先容咱们在作念的事。咱们公司叫光轮智能,是一家以仿真手艺运转,从具身场景切入,提供视觉和物理天下“东说念主在环”高质地合成数据的企业,但愿通过合成数据放大东说念主类对物理天下的示范价值。公司建造于2023年2月,是一家初创公司,咱们的愿景是成为具身范围的ScaleAI。
当今咱们的居品形态包括:高质地3D钞票:这是仿真中相聚数据的原材料,包括钞票、可泛化场景等。遥操用具链:适配不同硬件,且遥操链路在仿真中买通。强化学习平台:具身智能后测验阶段会用到,强化学习需要用GPU算力换取数据,因此需要大规师法真。咱们提供的强化学习测验平台,同期咱们我方也会用强化学习来考证场景和钞票。当今咱们事业的客户包括国表里头部具身智能公司、一些主机厂和顶尖高校。
底下快速展示居品Demo:
第一个场景是雪柜钞票。仿真中常见“看起来真确”的雪柜,而咱们作念的雪柜在视觉、交互及物理力学反映上齐弥漫真确。咱们会对其进行物理层面的力学建模,比如左边示例中,雪柜门开启角度不同,反映的力大小不同,这些力的大小是与真确雪柜对标相聚的;右边Demo中雪柜抽屉的阻尼力反映。这些能匡助具身智能相聚力的干统共据信息。
第二个Demo是农业场景的例子,源于客户的真确需求:需要高质地、可泛化的草莓(救济大小、面貌、不同锻练期的泛化),且场景需用于强化学习测验,因此这些草莓能被实操,供机械臂进行强化学习测验。咱们不仅在视觉层面作念了优化,也在物理及交互层面作念了研发。
有了钞票后,下一步是搭建场景,场景与真确天下的应用场景干系。比如针对客户需求,咱们会制作厨房、商超、工业、医学(如东说念主体内脏)等场景钞票。
前边提到仿真不错泛化,咱们不仅能在钞票类型、光照上泛化,也能在布局层面泛化。比如商超场景中,钞票自身及摆放齐可泛化,且这内部的每个钞票齐能孤独进行物理交互。
有了这么的场景,就不错在仿真环境下进行遥操数据相聚。由于不同机器东说念主和数据需求不同,咱们适配了不同遥操骨子,包括基于VR、机械臂、4D鼠标的遥操花式。同期,基于VR的遥操存在一个问题:VR眼镜脱色会导致机灵手遥操斥地看不笔直指,影响遥操精确度。咱们通过算法优化处置了这个问题——用多个相机相聚数据,让机灵手的位姿谈论更精确。左边示例中,苹果很难通过遥操捏取,而经由算法优化后,遥操员不错粗疏捏起苹果进行数据相聚。
临了共享一个案例:咱们在仿真中相聚数据,微调英伟达的GR00TN1基础模子,并实地部署到真机的后果。左边是东说念主工在仿真环境下进行遥操数据相聚,以及泛化仿真环境所相聚的合成数据;右边是将用合成数据微调后的GR00TN1部署到宇树的H1上,落地到工场场景的应用。
此外,咱们作念的用具和钞票也部分孝顺给了开源社区,包括前边提到的场景和搭钮钞票,其中有咱们开源的高质地厨房场景,也包括基于HuggingFace发布的机器东说念主LeRobot,在仿真中相聚数据、微调机械臂并最闭幕尾真机部署,还包括仿真钞票要领互转的干系插件。
若是全球对合成数据感深嗜,接待辩论咱们进一步交发配合。谢谢!
新浪声明:扫数会议实录均为现场速记整理,未经演讲者审阅,新浪网登载此文出于传递更多信息之指标,并不料味着赞同其不雅点或阐发其描述。
海量资讯、精确解读,尽在新浪财经APP
包袱裁剪:李想阳 世界杯体育
Powered by J9九游会·(中国)真人游戏第一品牌 @2013-2022 RSS地图 HTML地图