资讯中心

  • 首页
  • 资讯中心
  • 开源模型引领潮流!ZDTaichu5.0-9B在空间智能领域脱颖而出

开源模型引领潮流!ZDTaichu5.0-9B在空间智能领域脱颖而出

2026-09-18

紫东太初近期发布的通用多模态大模型 ZDTaichu5.0-9B 引起了广泛关注。尽管其参数量仅为 9B,但在空间具身智能的竞赛中却表现出色,如同一匹黑马。该模型在 9 项国际权威空间理解基准测试中获得了 8 项同参数组的第一名,在空间感知、跨视角三维推理和具身任务规划等多个指标上均优于Qwen3.5-9B和STEP3-VL-10B等同类模型。即使与闭源的Gemini 3 Pro和Grok 4等进行对比,ZDTaichu5.0-9B 在 5 项基准测试中同样位居榜首。此外,该模型在图文理解、光学字符识别、视觉数学及代码处理等多项通用多模态能力的评测中,依旧保持了前列的领先地位。

在涉及11项代理、代码处理、指令遵循和数学推理的测试中,ZDTaichu5.0-9B 显示出对比同类开源模型如Qwen3.5-9B、STEP3-VL-10B和gemma4-8B-E4B的明显优势。尤其在TAU2-Bench和IFEval两项测试中,ZDTaichu5.0-9B 甚至超越了闭源模型 Gemini 3 Pro。

伴随着模型的开源,紫东太初还披露了ZDTaichu5.0-9B的技术基础,采用了一种自适应循环推理的技术路线,这与GPT‑6 Astra使用的Loop Transformer技术有着相似之处,体现出团队的技术前瞻性。同时,紫东太初还开放了一整套经过验证的数据生产管道的详细方案,涵盖了预训练、监督微调、高质量退火和强化学习等环节。

现今,通用多模态模型在数字环境中的提升速度惊人,然而在物理互动领域则面临着不同的挑战。在具体应用中,一个机器人需在操作台上完成多个综合任务:准确识别目标的位置(空间感知)、在换视角后依然能够识别并推断空间关系(跨视角三维推理)、制定符合物理约束的动作计划(具身推理)。这些能力在数字世界的多模态测试中不易完全体现,但在物理世界中,缺失任何一个环节都会影响结果。

此外,空间具身推理所需的三维关系标注及操作约束数据与传统通用多模态的数据分布存在较大差异,简单地混合训练会使模型在参数有限时出现偏差。另外,空间推理任务内在的难度不均匀性也给模型带来了难题。虽然一些判断能够一步到位,但诸如参照系变换和多物体关系推演等问题则需要更复杂的迭代计算,而传统模型的算力分配往往是线性的,导致在资源受限的小模型上表现不如人意。

ZDTaichu5.0-9B采用了一整套数据生产管道来解决数据问题,同时利用自适应循环推理机制来优化复杂推理和算力分配的问题,成功提升了空间具身能力而不损害通用性能。

在复杂空间理解任务中,ZDTaichu5.0-9B的空间具身能力表现尤为突出,例如给定一张图像或视频,模型是否能够准确定位目标物体的坐标,并理解物体属性、空间排序和位置信息。测试中,ZDTaichu5.0-9B 成功输出了标准化坐标并准确命中目标,而其他参与对比的同类模型均未能定位正确,是其中唯一的优秀表现者。

在另一个主要层面上,模型需应对参照系转换的挑战。现实环境中的机器人常常需要在不同视角下进行工作,这要求模型理解变化源于观察角度的改变,而非物体位置本身的移动。通过示例,ZDTaichu5.0-9B能够准确判断其自身相对于目标物体的方位。

总的来看,ZDTaichu5.0-9B在提升空间具身能力的同时,确保了其通用能力的高效,标志着通用多模态大模型在物理世界中的重要进步。