(来源:iFLYTEK 科大讯飞集团)
一家公司的战略纵深,往往藏在关键的落子里。日前,一支专攻机器人通用底座的平台公司——爻方智能正式进入公众视野。依托科大讯飞AI底座能力,爻方智能将与聆动通用形成优势互补,面向具身智能行业共同增强战力。带队攻研机器人基座的这位科学家,是国家科技进步一等奖主要完成人、科大讯飞杰出科学家、具身智能前沿科学带头人——潘嘉,而他同时也是聆动通用的首席科学家。

从VLA到世界模型
机器人大脑的架构分水岭
就在近期,聆动通用联合爻方智能完成核心算法架构系统级升级,推出全新统一多模态具身大模型iFLYTEK-Embodied-Omni。针对传统视觉、动作串行推理模型存在误差叠加、时序控制不足的行业痛点,本次升级创新搭建“大脑-小脑”协同一体化框架:VLM、VGM高层模型负责指令解读、环境预判、长时序任务规划,AGM动作模型承接精细化运动控制,单一框架融合图像、视频、文本、机器人动作等多模态信息。


与行业主流VLA方案不同,传统VLA更像一个“即时反应系统”——看到什么就做什么,只管当下反应,不管做完之后世界会变成什么样。好比开车看到红灯知道踩刹车,但预判不到雨天路滑,这一脚下去车会打滑。只对当下做反应,不对后果做推演——这正是“VLA不是终局”这一判断的根本原因。

当下行业主流VLA衍生出世界模型路线,核心逻辑是先预判未来视觉画面,再据此生成机器人动作,实现 “先推演、再执行”。英伟达将Physical AI称之为年度核心词,通过各类世界模型不断刷新评测榜单推动热度,一定程度上促使行业整体呈现从VLA向WAM(世界动作模型)迭代的趋势。 视觉预测与动作生成分步执行,先输出未来画面,再通过逆动力学模块反解动作指令,视觉环节的微小偏差会持续传导、层层放大,形成学界所称的 “可执行性鸿沟”—— 模拟画面效果完美,实际机械臂作业却无法落地。
IFLYTEK-Embodied-Omni的解法与英伟达的联合训练思路异曲同工——不是把预测和动作拆成两步,而是把预测画面和生成动作塞进同一个模型里联合训练。但走到路口之后,两家迈的步伐就不同了。在英伟达的方案里,机器人的本体状态只是喂给模型的一个输入信号;而在聆动通用和爻方智能的视角里,认识本体是必达的训练,而逆运动学是任务本身。
依托四阶段渐进式训练方案,该模型在LIBERO-Plus、RoboTwin 2.0等国际主流仿真基准测试中斩获行业领先成绩,在长时序复杂分拣、装配任务的泛化能力与环境自适应层面优势显著,为通用机器人LDB、采训推机器人LDT全系列产品提供更强智能内核,大幅降低真实工业场景部署与迭代成本。
此次升级进一步夯实了聆动通用“大脑-小脑-本体”全链路自主可控能力——不是只有算法或只有本体,而是模型、硬件、场景三项皆成。爻方出基座优势,聆动持续保持在模型、本体和硬件上的先发优势。

资质验证与交付进展
模型的仿真测试成绩再亮眼,也终究要在真实物理世界里接受检验。
聆动通用已获得中国CR认证、欧盟CE-MD准入,并同步通过ISO9001、ISO14001、ISO45001三体系认证,是国内首款集齐双重资质的工业级具身智能通用机器人,拿到了国内与欧盟市场的“通行证”。
旗下覆盖“采-训-推”全链路的采训推机器人LDT系列,已在多个公共数据采集训练场、企业私有化训练场及高校科研机构稳定运行,覆盖泛制造业工艺优化、具身大模型训练数据供给、科研教学验证等真实需求。该产品以多项满分通过中国信通院EAI Bench“物流分拣”任务全部评级,聆动通用也是唯一基于全栈自研方案完成“感知-决策-行动”全体系评测的参评单位。
目前,另一款通用机器人LDB系列也已在物流业、汽车业、3C应用领域等多个真实场景逐步启动交付验证。

讯飞系具身智能的“优势互补”布局
据此,科大讯飞在具身智能赛道的布局已然清晰:聆动通用负责工业具身“大脑-小脑-本体”全链路自主可控,同时兼具本体硬件和商业化,为算法提供最直接的验证载体和迭代反馈;爻方智能提供底座,两者联手以优势互补的方式,让算法定义硬件、硬件验证算法——形成一个不断加速的正向飞轮。
截至目前,放眼整个市场,能够让“大脑”和“身体”双强、并把它们拧合在一起的企业屈指可数。大多数公司只能选一头,另一头等别人成熟再来采用。而科大讯飞提出的方式是:让爻方智能提供的底座从第一天起就可以通过聆动通用研发的本体进行验证;让聆动通用每一台交付的机器人都同时在为下一代“底座”回传真实数据。这种“同时造引擎和造车身”的双核路径,正是来自科大讯飞在人工智能行业内沉淀二十余年的底气。那条从实验室到“真正下厂干活”的最难通道,正在被这套落地打法逐步验证与实现。
文中数据源于实际应用
本文通讯员:王尧

——工业智能全场景解决方案专家
2026-07-24 18:51:13



热门资讯
猜你喜欢



