紫东太初开源 ZDTaichu5.0-9B:10B 参数内空间具身能力最强通用多模态大模型
9月15日,紫东太初正式开源ZDTaichu5.0-9B,模型不大实力超群,空间理解专业能力同档最强,通用能力仍居第一梯队。更稀缺的是,本次ZDTaichu5.0-9B不只开权重,更公开数据生产详细方案,并已在科研自动化、智能制造真实实体场景完成验证。此次开源,意味着国产多模态大模型正从“看懂数字世界”迈向“理解并行动于物理世界”。

ZDTaichu5.0-9B模型参数量约 9B,支持单图、多图、长序列视频与任意分辨率视觉输入,聚焦解决真实物理场景下空间感知、跨视角变换、具身任务规划等行业难题。评测结果显示,ZDTaichu5.0-9B 是 10B 参数内空间具身能力最强的通用多模态大模型,九大国际权威空间理解基准斩获 8 项组别第一。同时,ZDTaichu5.0-9B创新新采用自适应循环推理架构,对标行业前沿闭源模型 GPT-6 Astra,展现出高度对齐的技术前瞻性。

当前行业一大技术难点在于:提升模型空间具身能力,往往会牺牲模型原有通用多模态能力。ZDTaichu5.0-9B 完成突破,在空间能力越级提升的同时,图文理解、OCR、视觉数学、代码 Agent 依旧保持第一梯队水准。

权威基准碾压同级:10B参数内空间具身综合能力第一
在空间具身能力评测上,本次横向评测选取 Qwen3.5-9B、STEP3-VL-10B、gemma4-8B-E4B 等开源模型,同时对比 Gemini、Grok 等闭源大模型,覆盖空间感知、三维推理、多视角变换、具身交互九大权威评测基准,八项取得同参数组别第一名。

模型构建起四层递进能力链条:空间感知→复杂三维空间推理→具身条件推理→物理交互决策,真正实现从 “看懂二维世界” 到 “理解三维物理世界并规划决策” 的跨越。
在空间感知方面,模型可精准识别物体、方位、排布秩序,视频目标定位能力同级领先。在视频定位实测案例中,针对 “寻找从左到右第二个银色盒子” 任务,ZDTaichu5.0-9B 精准输出目标坐标,同级其他开源模型全部定位错误,该能力是机器人抓取的底层核心能力。

在复杂空间推理方面,直击机器人移动、机位变化后 “认不出、判不准方位” 的行业痛点。代表复杂三维推演能力的 MindCubetiny 取得 78.27 分,大幅领先同级竞品;跨视角评测 ViewSpatial 同样拉开差距。三视角推理实测中,参照系发生改变时,仅有本模型输出物体的正确相对方位,其余模型出现参照系错乱,可保障机器人运动过程中物体空间拓扑关系稳定。

具身推理与交互理解层面,模型不止识别画面物体,还可完成空间逻辑推理,判断物品可放置区域、识别操作前置条件。在 ERQA、RoboSpatial 两大机器人具身交互基准取得同参数开源模型第一。杯柄侧空闲区域选择测试中,模型输出点位落在合理空闲区域,对比模型点位全部落在物体占用区域,输出结果可直接用于机器人交互。

通用多模态能力上,ZDTaichu5.0-9B 在图文理解、视觉数学、OCR、指令遵循、数学、代码工具调用多项指标表现优异,通用底座能力没有伴随空间能力增强而受损。


行业稀缺:对外开放整套空间多模态数据生产管线
不同于市面上多数项目仅开放模型权重,本次紫东太初沉淀了一套经过全流程验证,对外可复用、可迁移到行业自有数据集的完整数据工程链路,迁移整套空间多模态数据生产管线,解决企业拿到模型权重,却无法基于自有工业、机器人数据迭代模型的行业痛点。
整套链路完整覆盖预训练、监督微调、高质量退火、GRPO 可验证强化学习全部环节,包含哈希-URL 双重去重、画质过滤、三维能力标签体系、思维链合成、一致性校验等全套工艺。科研机构与企业开发者可复用这套流水线,将自有仿真数据、工业现场数据、实验场景数据转化为模型训练样本。
训练采用渐进式数据课程体系,实现模型能力阶梯式生长。
预训练阶段整合开源图文、网页文档、视频、三维仿真场景多源数据,经过清洗、过滤、解析处理,完成视觉、语言、时序、三维空间概念的基础对齐。

监督微调 SFT 阶段,采用大规模任务轨迹样本,对具身样本强制做多维度一致性校验,通过多轮对话、视频序列样本构建,教会模型结合视觉证据完成任务拆解、工具调用、具身交互。

高质量退火 + GRPO 可验证强化学习阶段,搭建能力域难度质量三维自动标签系统,定向筛选优质样本;设置答案正确性、坐标命中、格式合规多重自动奖励信号,将空间点位输出、结构化规划转为可训练目标,适配长视频、长链条具身推理任务。

自适应循环推理,把算力用在真正难的判断上
为解决空间预测不确定性,支撑高难度空间判断算力需求,ZDTaichu5.0-9B 内置自适应循环推理机制。该推理迭代运行在模型前向传播内部,和 “业界猜测”的GPT-6 Astra 所采用 Loop Transformer 技术路线具备高度的前瞻性,在不扩张参数量前提下提升模型有效推理深度。

工作逻辑依靠熵门控判断任务不确定性:确定性任务直接输出结果,不消耗额外算力;面对空间变换、物体关系判别等高不确定性任务,模型会在内部循环迭代优化隐层表征,无需依赖外部思维链输出。
同时配备阻尼更新、双重停止判据、轨迹读出与状态回滚三重稳定化工程,保障内部循环不会发散。内部循环聚焦提升单步感知推理质量,复杂长程具身任务则依靠外部任务循环接收环境反馈更新全局状态,两层架构协同完成物理世界复杂任务。这套机制让算力向高难度难题倾斜,在不显著增加平均推理成本的情况下,提升复杂任务正确率。
长程具身智能:驱动物理世界持续交互与自主决策
真实物理世界下的长程具身任务,包含大量相互依赖的链式操作:识别目标、处理遮挡、移动到合适观测位置、打开容器、调用工具、搬运物体,最后校验目标是否完成。高层具身规划,要求模型持续维护全局完整任务状态,而不是为每一张输入图像独立生成单次动作。

当下热门的通过 Astra 控制端侧设备领域,我们的模型也同样具备硬核竞争力。ZDTaichu5.0-9B无需人工分步引导,可直接融合实时图像画面、用户目标描述与设备执行反馈,自主研判场景、规划操作步骤,一键输出精准有效的设备控制指令。整套操作全程自主闭环,能够高效驱动端侧工具、智能设备完成既定任务,完美适配复杂的实操场景。

从跑分到实干,让模型真正进入物理世界
依托四层能力链条与自适应推理架构,ZDTaichu5.0-9B 可以实现真实物理世界的长程具身任务闭环。长流程物理任务需要持续跟踪物体身份、位置以及任务进度,依据环境新观测更新状态,而不是机械执行初始动作列表。
在科学智能场景,模型可以打通干湿实验闭环,仿真侧仿真计算链路:接收自然语言科学问题,自主调用 Python/SciPy 工具,同时求解解析解与数值解,交叉比对校验结果,自动输出相空间图、位移速度时序曲线等可视化产物,完成从提问到分析图表报告全流程。

湿实验侧,ZDTaichu5.0-9B 能够在复杂实验环境中持续跟踪物体状态、空间关系与任务进度,依据观测结果动态更新策略,形成从感知、推理到行动的完整闭环,持续将样品身份、空间位置、任务进度三者绑定跟踪,为自动化科学实验平台提供上层任务编排与状态记录能力。

面向工业智能制造场景,模型适配备料配送、机台上料业务,应对密集货架、零件外观相似、物体遮挡等车间现实问题。在跨工位配送、机台上料实测案例中,模型接收工单文本,完成高层语义理解,输出从货架取件、搬运避障到放置到位的完整任务规划,打通工单指令到车间物理执行的链路。

ZDTaichu5.0-9B 的开源发布,打破了物理世界多模态大模型 “权重易得、能力难复现” 的行业困局,为具身大脑、智能制造、自动化科学实验领域,交付了兼顾顶尖空间具身能力与完备通用素养的国产化核心底座。
不止释放模型权重,整套经过工程验证的空间多模态数据生产管线同步对外开放,把过去少数团队掌握的核心数据工艺向全行业敞开,大幅拉低具身智能的创新门槛。这不止是一款大模型的开源,更是推动 AI 从读懂屏幕里的数字信息,走向理解、决策、交互真实物理世界的关键一步。它将激活产学研协同创新活力,加速我国具身智能生态的构建与迭代,为实体经济智能化变革注入硬核底层力量。
关于紫东太初:
中科紫东太初由中国科学院自动化研究所孵化,是跨模态通用人工智能领域的“国家队”企业,以“打造自主可控的中国通用人工智能底座,成为全球领先的多模态大模型技术创新者与产业赋能者”为使命。公司自主研发的紫东太初多模态大模型,是全球首个中文千亿参数级多模态大模型,凭借领先技术实力荣获世界人工智能大会最高荣誉——卓越人工智能引领者奖(SAIL奖),并成为首批通过中央网信办大模型备案、荣获中国信通院大模型可信认证的“双认证标杆产品”。

热门文章
Omdia:iPhone用户在微短剧上的消费比安卓安卓用户高出40%
光影致敬实业奋斗者——《有你真好1》观影暨《再创新辉煌》有奖征文活动启事
维权落地资产安全稳固 药易购经营底盘稳健蓄力数智化长期增长
派逊亮相2026年江苏省中小学生实验能力大赛总决赛,助力“实践育人”
从生产计划到仓储管理,勤哲Excel服务器提升制造业管理效率
杭叉集团举办首届AI DAY科技日 正式发布LogiMind具身大模型与全系列叉车机器人