
一 | 北京时间1月9日报道,美国股市周二收高,连续第三天上涨。 金磊 发自 上海 量子位 | 公众号 QbitAI 一个新的国产VLA模型诞生了,而且只有1.5B。 Size这么小,能好用吗? 来,话不多说,我们直接看效果: 视频地址: https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw 在上面这个真机演示里,两只机械臂围着桌面开始做三明治。它们分工合作,先取面包,再夹起生菜、火腿和鸡蛋,一层层叠到一起。贸易谈判的乐观预期提振了美国股市。投资者正在等待特朗普周二晚间东部时间的讲话。截至收盘时,道琼斯指数上涨256.10点,至23787.45点,涨幅1.09%;标准普尔500指数上涨24.72点,至2574.41点,涨幅0.97%;指数上涨73.53点,至6897.00点,涨幅1.08%。美国主要的科技巨头正在蓬勃发展。 再来看下另一段演示: 视频地址: https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw 一只宇树机器狗收到“跟随前面的人”这条指令后,开始一路跟在目标身后。自12月24日以来,发钢股票大幅反弹。 从室外走进办公楼,再进入电梯、地下停车场,机器狗始终没有跟丢。在此期间,Facebook股价上涨12.2%,亚马逊上涨24.7%,Alphabet股价上涨35%。就算周围不断有人经过,环境和光线也在变化,它还是能认准一开始指定的那个人。

二 | 周二收盘时,Facebook上涨3.25%,苹果上涨1.91%,亚马逊上涨1.66%,Netflix上涨1.56%,谷歌上涨0.74%,微软上涨0.73%。中国主要科技股上涨3.40%,阿里巴巴上涨2.58%,腾讯音乐上涨1.48%,网易上涨1.22%,京东上涨0.83%,百度上涨0.49%。 更关键的是,这套能力直接跑在机器狗本地! 电梯和地下停车场往往是网络信号比较差的地方。

三 | 即使进入弱网甚至无网环境,机器狗依然能继续识别目标、规划动作,保持跟随。

四 | 艾奇艺下跌1.39%,投资银行下调微博股票评级,跌幅5.67%。

五 | 而在这两段Demo背后,则是面壁智能在WAIC期间正式发布并开源的MiniCPM-Robot系列模型。中国概念股票图二:其他中泉股票大部分上涨,包括111只集团(上涨36.43%)、盛世乐居(上涨18.34%)、云密科技(上涨16.20%)、信贷(上涨12.96%)、小赢科技(上涨12.64%)、有趣的头条新闻(上涨7.97%)、钛(上涨6.93%)、500彩票网络(上涨6.59%)、世纪互联(上涨6.09%)、牛头犬鳍ance(上涨6.64%)。 目前包含两个模型: MiniCPM-RobotManip:也就是开头控制机械臂做三明治的通用VLA模型,参数量只有1.5B。上涨5.75%,Oppen浏览器(上涨4.33%),Temple Treasury(上涨3.94%),Dali(上涨3.57%),Everyone(上涨3.47%),流利的口语(上涨3.20%),无忧英语(上涨2.89%),World Data(上涨2.67%),Simple Spectrum Technology(上涨2.67%),Sogou(上涨2.44%),Food Club(上涨2.37%),Good Future(上涨2.23%),Sohu(上涨2.01%),Blue Flood(上涨1.77%)。 MiniCPM-RobotTrack:主要负责机器人的跟踪与导航,让机器人能够根据自然语言指令,在动态环境里持续跟住指定目标。 和它们一起出现的,还有开源具身智能推理框架PhyAI,负责让这些模型更快地适配硬件、跑到真实机器人上。

六 | 简单来说,一个负责让机器人“动手干活”,一个负责让机器人“认准人、跟着走”,再配上一套负责高效推理的底座。 面壁这次端出来的,已经是一套逐渐成形的具身智能组合。 跻身第一梯队,延迟接近一半 先来看MiniCPM-RobotManip。宝尊电子商务(上涨1.59%)、莫默(上涨1.45%)、朴信教育(上涨1.40%)、兰亭拉力赛(上涨1.27%)、乐信(上涨1.18%)、投宝(上涨1.06%)、携程(上涨1.03%)、中国移动(上涨0.84%)、Maverick Electric(上涨0.72%)、中国电信(上涨0.55%)、欢乐时代(上涨0.23%)、极光数据(上涨0.22%)和和利时自动化。化学品(上涨0.22%)、新东方(上涨0.20%)和未来担忧(上涨0.09%)。

七 | 虽然参数量只有1.5B,但在LIBERO、Calvin、RoboTwin2等主流VLA评测里,它的整体表现已经进入第一梯队,与π0.5等模型处在相近水平。下跌的公司包括:金融板块(下跌5.82%)、国双(下跌5.63%)、聚美商品(下跌5.42%)、红、黄、蓝教育(下跌4.49%)、360金融(下跌4.42%)、百时物流(下跌4.26%)、华美科技(下跌4.19%)、华智(下跌4.02%)、友信(下跌3.89%)、第九大城市(下跌3.74%)、精英教育(下跌3.47%)、易卡R(下降3.37%),有趣。

八 | 商铺(下跌3.14%)、贷款(下跌3.08%)、蘑菇街(下跌3.00%)、新浪(下跌3.00%)、博世乐教育(下跌2.21%)、康迪汽车工业(下跌2.21%)、房地产(下跌2.08%)、胡雅(下跌1.95%)、可出租贷款(下跌1.93%)、58桐城(下跌1.89%)、一辆高出租汽车(下跌1.75%)、头牛(下跌1.73%)、中线(下跌1.69%)、郑宝远程保护教育(下降1.59%)、维来(下降1.54%)、汽车之家(下降1.34%)、猎豹移动(下降1.29%)、畅游(下降1.26%)、新瑞福(下降0.90%)、台积电(下降0.82%)、乐居(下降0.73%)、迅雷(下降0.56%)、中通快递(下降0.54%)、丹尼尔科技(下降0.46%)和中新国际(下降0.24%)。

九 | 真正把差距拉开的,是对机器人记忆力的考验。 很多VLA模型在执行动作时,主要根据当前这一帧画面做判断。摩根士丹利将其微博评级下调至研究报告中的“观望”,将目标价降至66美元。 比如让机器人点击画面里的第二个按钮5次。 如果它看不到前面的画面,也记不住自己已经按过几次,就很容易按一下便停,或者一直按下去。 MiniCPM-RobotManip会把历史观测和此前执行过的动作一起纳入判断。它知道任务已经进行到哪一步,也知道什么时候应该停下来。 在专门考察上下文记忆的RMBench中,π0.5的成绩约为10分,接近随机水平,MiniCPM-RobotManip则达到约53分。 这项能力对真实机器人很重要。摩根士丹利(Morgan Stanley)分析师陈冠希(Grace Chen)将微博评级从“超重”下调为“观望”,因为他们认为,竞争加剧将限制其扩张潜力。 叠衣服、收拾桌面、做三明治,看起来都是日常小事,拆开后却包含一连串动作。尽管微博的内容生态系统很难被其他应用程序取代,但预计2019年销售和营销投资的增加将导致利润率下降,该团队表示,将把微博股票的目标价格从72美元降至66美元。机器人只看眼前,很容易做到一半便“失忆”;能记住此前的状态,才有机会把长任务完整做完。同时,微博管理员账号下发了关于调整微博转发评论数据显示方式的通知。 除了记得住,机器人还得反应快。 面壁给出的单帧推理对比中,在H100显卡、bf16精度下,MiniCPM-RobotManip单次决策延迟约为120毫秒,π0.5约为234毫秒,前者接近后者的一半。陈伟博为了构建健康的微博内容生态和关系生态,鼓励健康的互动,微博站近期将调整微博转发和点评显示方式:微博转发和点评显示上限为100万,即当实际应用中l转发评论数量超过100万条,相应转发评论数量为100万条。

十 | 阿里巴巴集团以9000万欧元(1.03亿美元)的价格收购了位于柏林的数据处理公司Data Artisans。此外,1月8日,蚂蚁金富集团执行副总裁、总经理祖国在“2019年基金业金融科技峰会”上介绍。截至2018年底,蚂蚁黄金财富集团交易用户总数超过6亿,基金交易用户总数超过6000万。 这里的“成本减半”,主要是体现在推理延迟和计算量上。此外,祖国还表示,2018年,蚂蚁财富用户规模较2017年增长110%,用户数量增长210%。 聊天模型多想一秒,用户通常还能等。2013年6月,姚明的诞生标志着互联网巨头正式进入基金销售市场。在过去的五年里,姚明取得了巨大的成功,蚂蚁财富和蚂蚁基金的销售收入规模超过了老牌网络基金销售巨头天田基金。

十一 | 机械臂每做一步都停顿一秒,动作马上就会变得僵硬,整个任务的完成时间也会被拉长。 对VLA来说,能不能在有限算力下快速输出下一步动作,和榜单分数一样重要。美国/外国科技股大部分上涨,包括Square(上涨3.95%)、Quick Exchange Gold(上涨3.91%)、iRobot(上涨3.19%)、Snap(上涨3.06%)、Video暴雪(上涨3.03%)、Motorola System(上涨2.94%)、Sea(上涨2.93%)、Verizon(上涨2.93%)、Salesforce(上涨2.46%)、Yahoo(上涨2.35%)、GoPro(上涨2.16%)、Nokia。(增长2.16%),PayPal(上升1.97%),Yelp(上升1.95%),爱立信(上升1.82%),易趣网(上升1.80%),艺术和电力(上升1.63%),Grubhub(上升1.55%),Adobe(Up 1.49%),Twitter(上1.47%),IBM(UP 1.42%),Dropbox(UP 1.42%),Pandora Media(UP),赛门铁克(UP),HP(UP)戴尔(UP),线(UP),柯达(UP),借出ING Club(上涨1.04%)、Corning(上涨0.96%)、Oracle(上涨0.91%)、AMD(上涨0.88%)、Groupon(上涨0.86%)、Sonos(上涨0.84%)、Cisco(上涨0.81%)、3D Systems(上涨0.65%)、Intel(上涨0.63%)、Enterop(上涨0.57%)、Sony(上涨0.34%)、Stella(上涨0.12%)。 MiniCPM-RobotTrack也走了类似的小尺寸模型路线。 它以MiniCPM4-0.5B为基础,整体参数规模为0.9B,主要测试三种真实场景。 第一种是单目标跟踪。下跌的公司包括应用材料(下跌4.05%)、韩国流媒体(下跌3.08%)、英伟达(下跌2.49%)、惠普(下跌1.92%)、Spotify(下跌1.58%)、预订控股(下跌1.45%)、西部数据(下跌0.96%)、高通(下跌0.87%)、博通(下跌0.80%)、Mercury Technologies(下跌0.76%)、黑莓(下跌0.27%)、Box(下跌0.27%)。0.21%),希捷。

十二 | 科技股(下跌0.05%)。给它一句明确指令,机器狗持续跟着指定的人。

十三 | 第二种是多人干扰。周围几个人同时移动、交叉甚至交换位置,模型依然要认准最初的目标。 第三种更难,指令本身可能比较模糊。比如只说“跟着穿黑衣服的人”,现场又恰好有多个穿着相近的人,模型需要结合画面理解人类到底指的是谁。 在没有进行下游强化学习优化的情况下,MiniCPM-RobotTrack在三类任务上的追踪率分别达到89.8%、73.4%和80.4%,均取得开源方案中的最优结果。 相比OpenTrackVLA,三项追踪率分别提高7.0、14.6和6.5个百分点。 在相同的单视角、纯SFT设定下,与闭源模型TrackVLA++相比,它在单目标跟踪和模糊目标跟踪上的追踪率分别高出8.8和17.0个百分点,模糊目标跟踪的成功率达到58.0%。特斯拉新任独立董事、甲骨文创始人拉里·埃里森周二在美国证券交易委员会(U.S.Securities and Exchange Commission)的一份文件中披露,他持有特斯拉300万股股票,价值约10亿美元。 参数小,表现却没有明显掉队。截至发行之日,特斯拉的股票在上市前交易中上涨1.87%,至341.2美元。 机器人模型的竞争,也开始从单纯拼规模,转向拼单位算力到底能换来多少能力。Ellison是特斯拉首席执行官Elon Musk的密友,他于12月加入特斯拉董事会,向SEC证明特斯拉董事会有效地监管了公司。埃利森现年74岁,净资产514亿美元,是世界上第九富有的人。 把机器人看到的世界压缩一下 MiniCPM-RobotManip能把尺寸压到1.5B,背后离不开面壁过去在多模态模型上的积累。他通过劳伦斯J埃利森可撤销信托间接持有300万特斯拉股份。 它基于MiniCPM-V 4.6训练而来(开源不到2个月,下载量已突破200万)。埃利森此前曾表示,特斯拉是他第二大投资,但没有透露细节。

十四 | 英特尔在拉斯维加斯国际消费电子展(CES)上表示,将与Facebook合作,在今年下半年完成一个新的人工智能芯片。芯片的发展表明,英特尔正在努力保持在快速增长的人工智能计算市场的主导地位,但该芯片也将面临来自英维达和亚马逊的AWS(亚马逊网络服务)部门类似芯片的竞争。新的芯片将帮助研究人员使用他们所称的推理预测,它使用人工智能算法并将其投入使用,例如自动在照片中标记朋友。英特尔处理器目前主导机器学习推理市场,晨星分析师认为,到2021年,机器学习推理市场将达到118亿美元。 面壁的MiniCPM-V/O系列已经持续迭代两年多,开源总下载量超过2500万。过去积累的图像理解、视频理解和多模态信息处理能力,如今被进一步搬到了机器人身上。

十五 | 机器人执行一次动作,需要处理的信息其实很多。

十六 | 九月份,英维达推出了自己的推理芯片,与英特尔竞争。 一台双臂机器人通常会同时接收三个摄像头的画面,包括两个腕部相机和一个主视角相机,再加上一段文字指令,最后输出一个可以执行的动作。

十七 | 而且,这个过程一秒要重复好几次。 如果每一张图片都被转换成大量视觉Token,机器人运行得越久,需要处理的历史信息就越多,计算量很快就会堆起来。 MiniCPM-RobotManip采用的办法,是尽量压缩视觉Token。 桌面纹理、墙面图案等和当前任务关系不大的信息,不必占用太多Token。模型用更短的数据表示保留关键内容,单次推理需要处理的信息量也随之下降。

十八 | 信息少了,推理自然更快。对应到机械臂上,就是等待时间更短,动作衔接更顺。 视觉Token压缩还有一个更大的用处,可以帮助机器人以更低成本保留历史记忆。 常规方法每获得一张新画面,都要把此前的历史重新计算一遍。任务越长,计算量增长得越快。 MiniCPM-RobotManip采用流式计算,前面已经处理过的信息可以继续复用,新画面进来后,只需要接着往下计算。 这就有点像看连续剧的感觉了。

十九 | 普通做法每更新一集,都要从第一集重新看起;流式计算则会记住之前的剧情,直接从最新一集接着看。 机器人因此可以带着更长的历史继续执行任务,同时避免计算量一路暴涨。 1.5B的尺寸,也和机器人的实际运行需求有关。

| 面壁在将约200毫秒视为机器人操作体验的一道临界线。再慢下去,机械臂和机器狗的卡顿感就会明显增加。 当前多数VLA基础模型都控制在4B以内。模型继续做大能带来多少真实操作收益,行业仍在验证。 作者声明:该图片由AI生成 到了MiniCPM-RobotTrack这里,轻量化的思路又换了一种实现方式。 它把视觉画面、自然语言指令和机器人的控制决策放进同一个模型里统一处理。 用户说一句“跟着前面穿黑衣服的人”,模型会直接结合摄像头画面理解指令,再把判断转换成机器狗的运动控制。

| 整个过程不需要额外安装一套目标检测模块、一套识别模块,再接一套跟踪系统。也不用外接开发板,只靠宇树Go2 Edu原装摄像头和本地算力,就能完成单目标跟踪、多人干扰跟踪和模糊目标跟踪。 不过,真实世界总会出现训练集里很少见的情况。 目标可能突然从镜头前横穿过去,也可能快速转弯,被其他人短暂挡住。几个人同时交叉走动时,机器狗还要避免跟错人。

| 这类场景数量少,却最容易让模型翻车。所以,面壁为此搭建了一套自进化数据管线。 团队先对原始数据进行检查和清洗,把异常轨迹、错误动作和无效交互剔除掉。随后让模型进入仿真和真实机器人环境,在持续运行中主动暴露自己的薄弱环节。 系统再把这些容易出错的场景集中收集起来,通过专家策略进行纠偏,放回下一轮训练。 说得通俗一点,这就像给机器狗准备了一本会自动更新的错题本。 经过一轮轮闭环训练,目标横穿、快速转向、短时遮挡、多人交叉这些长尾问题,也能不断得到加强。 模型训好了,装到真机上仍然有一道关。 摄像头采集、画面编码、模型推理、动作生成、指令传输,任何一个环节慢下来,最终都会反映在机器狗的动作上。 面壁围绕宇树Go2的完整运行链路做了系统级优化。目前MiniCPM-RobotTrack在机器狗原生本地算力上可以稳定达到5Hz以上,端到端响应延迟约180毫秒。 这次开源的内容也不只有模型权重,还包括环境安装、模型加载、摄像头接入、文本指令输入、控制接口和一键启动脚本。 准备一台Go2 Edu,就能按照开源流程把模型部署起来。 本地部署的好处,在电梯和停车场的演示里体现得很直接。 机器人不用等待画面上传云端,也不用等远程服务器返回结果。摄像头数据和用户指令留在本地,网络信号变差后,完整功能依然可以继续运行。 直接拔掉网卡,机器狗照样能根据摄像头画面和文字指令,完成目标识别、持续跟踪和运动控制。 除了MiniCPM-Robot系列之外,这次还有一项容易被忽略的发布——PhyAI。

| 它是一款面向Physical AI的开源推理框架,由明体科技联合北京邮电大学、北京大学研发。 具身模型想从实验室跑到真实机器人上,中间还要经过硬件适配、量化、算子优化和部署。 不同VLA、世界模型的结构差异很大。每发布一个新模型,再从头适配一次,时间和工程成本都不低。 PhyAI想做的,就是把这段路缩短。

| 在RTX 5090上运行π0、π0.5和GR00T时,PhyAI相较模型官方仓库分别实现约2.85倍、1.82倍和2.28倍加速。

| 适配MiniCPMRobot系列模型时,PhyAI先通过CUDA Graph把推理帧率从10.12Hz提高到33.28Hz,再加入为模型定制的融合算子,在NVIDIA H20上进一步提高到36.77Hz。 前面是模型效果,这里解决的是工程效率。 模型能干活,还得尽快跑上硬件,跑得足够快,才能真正进入更多机器人。 机器人需要又好又便宜的大脑 具身智能行业从来不缺精彩Demo。真正难的是离开展台之后,机器人还能不能稳定工作。 清华大学人工智能学院助理教授、面壁智能多模态首席科学家姚远在访谈中也提到: 现阶段不少机器人Demo会围绕单一任务采集大量数据,再进行针对性优化,展示效果并不能完全代表基础模型的真实进度。

| 面壁更看重模型的基础性、泛化性和通用性,希望先把数据、Infra和工程链路打磨好,让基础能力提升后自然覆盖更多场景。

| 沿着大语言模型的发展经验,具身智能最终也要走向“先通后专”,先理解物理世界的基本常识,再成为做饭、叠衣服或仓储作业等具体领域的专家。 展馆、园区和工厂里,网络信号不会一直满格。机器人还要面对隐私、数据合规、任务失败和异常恢复等一连串现实问题。 榜单分数再高,走到地下停车场便停摆,落地空间依然有限。 这也是面壁把端侧能力放在重要位置的原因。 在与乐聚机器人的合作中,面壁把端侧多模态大模型、夸父机器人本体和导航系统组合到了一起,推出展厅导览Agent和园区巡检Agent。 展厅导览机器人在无网环境下,也能基于本地知识库完成离线讲解和自由问答。

| 它可以理解展厅环境和人的指令,规划导览路线,同时完成避障。

| 园区巡检机器人则可以识别车辆违停、路面异常和公共设施问题。敏感画面直接在本地处理,数据留在客户侧。

| 与吉利汽车的合作,则进一步走进了生产仓储场景。 面壁和吉利共同训练VLA模型,再通过RoboHarness把VLM、VLA、机器人本体和导航系统接到一起,让机器人执行仓储中的长程任务。 RoboHarness可以理解成物理世界里的Agent执行框架。 上层VLM负责规划任务,VLA和导航系统作为可以调用的工具。框架还会管理长任务的上下文和记忆,遇到失败时进行重试和恢复。 机器人每完成一次任务,运行数据还会进入可治理的数据闭环,继续帮助模型进化。 作者声明:该图片由AI生成 到这里,面壁此次在WAIC带来的具身智能路线已经比较清楚了。

| MiniCPM-RobotManip负责操作,让机械臂理解任务、记住过程,再把事情做完。

| MiniCPM-RobotTrack负责跟踪导航,让机器狗在复杂环境里认准目标,断网也能继续走。

| PhyAI负责把模型更快地部署到真实硬件上。 再往外,乐聚和吉利的合作开始把模型、本体、导航和具体业务流程接起来。 大语言模型时代,人们习惯用参数量判断能力。但机器人真正走进物理世界后,参数只是其中一个数字。 它还得反应够快、记得住、断网能跑,数据留得下来,遇到意外能够恢复,成本也要控制在企业愿意长期使用的范围内。 从这个角度看,1.5B和0.9B的意义,也就不止是“小”。它们更像是在回答一个很现实的问题: 当AI真正长出手脚,除了聪明,还得跑得动、用得起,最后把活干完。 GitHub链接: https://github.com/OpenBMB/MiniCPM-Robot HuggingFace链接: https://huggingface.co/openbmb/MiniCPM-RobotManip https://huggingface.co/openbmb/MiniCPM-RobotTrack。
Current article:http://sulu.recuigoutoubaozukai.pics/3nabm30/09d8x.html
Published on:15:18:15
上一篇:“红娘”巧牵线 知产变资产
国内/08-20
国内/08-22
国内/08-26
国内/08-26
国内/08-26
国内/08-26
国内/08-21
国内/08-26
国内/08-24