来源:光子星球
就在今天凌晨,智谱的GLM-5.3-Flash模型正式上线并开源。
此前一周,它以Ox-Alpha的匿名身份在OpenCode和OpenRouter上公测,并迅速登顶双平台调用量榜首。社区赋予它中文名“牛来”,既呼应“牛市”寓意,也暗合Ox(公牛)的本义。
定价方面,GLM-5.3-Flash标价为GLM-5.3的1/10,限时优惠期内仅为1/20。按每百万token计,输入0.075美元,输出0.25美元。相比之下,DeepSeek-V4-Flash的最低输入价为0.22美元,输出0.66美元。GLM的输入成本便宜近3倍,输出便宜2.6倍。而与其性能同级的Claude Opus 4.8,定价则为GLM的40倍。
我们花费整整一晚,将模型接入真实开发环境,用一套面向实际工作流的测试方案进行实测。结论明确:原生多模态能力显著提升前端开发效率,Agent稳定性超出预期,但复杂3D场景仍存在瓶颈。
一、这头“牛”到底什么来头?
GLM-5.3-Flash属于GLM-5系列,是首个原生多模态模型。总参数量为320B,但每次推理仅激活18B(约180亿)参数,采用稀疏激活架构,在保持高性能的同时大幅降低计算成本。
关键规格:
上下文长度:1M token,可处理长篇文档、整部代码库或长时间视频;多模态能力:视觉编码器与语言模型深度耦合,能直接“看见”图像、截图、渲染结果,并基于视觉反馈修正代码;接口兼容:提供OpenAI格式API,可无缝接入各类Agent框架和工具链。
官方在Artificial Analysis Intelligence Index(AA 综合智能指数)中给出57分,与Claude Opus 4.8持平。在Terminal-Bench 2.1和DeepSWE基准上分别取得84.3和63.4分,高于DeepSeek-V4-Flash的82.7和54.4。
不过社区存在一些质疑声音,认为部分任务仍稍逊于Opus 4.8。因为官方未公开完整benchmark报告,所以我们决定亲自验证。
二、纸上数据很漂亮,社区为何吵翻天?
我们摒弃传统的单轮问答测试,转而模拟真实工作场景中的多步骤、跨工具任务。所有测试均在API环境下进行,模型需自主调用工具、处理多格式输入、并根据中间结果迭代修正。
测试共6项,难度递进,覆盖从设计稿到代码、从视频到文稿、从算法优化到跨应用自动化、从3D场景到视觉纠错等多个维度。
(一)草图扔进去,网页直接跑起来
这里我上传了一张网络安全大数据平台的仪表盘图片,在仅输入一句“根据图片生成一个可交互网页”的情况下,让我们看看5.3-Flash会有什么样的表现。
差不多5分钟后我们拿到了运行结果:除了部分UI一些细微的差别,在设计上的观感可以说是一模一样了,我们本以为这种看起来交互复杂的页面,还需人工再调整几次,但没想到一次就输出了不错的效果。
在原生多模态的“看图编程”方面,GLM-5.3-Flash确实可以将原型设计到初稿状态,同时其代码周期压缩到了令人难以置信的地步。
(二)5分钟的纪录片,文案精华搞定
接下来要测试视频理解能力,这里由于测试平台以及时间上限制,我们只选取了一个五分钟的纪录片作为素材,要求模型提取视频核心论点、关键数据和视觉元素,最后按“问题-论证-结论”的叙事结构重组,输出文案文稿。
测试结果显示,GLM-5.3-Flash生成的摘要并非简单截取字幕,而是将分散在不同时间点的三个实验案例串联成一个逻辑链条,这展示了它跨段落的语义理解和内容重构能力。
处理总耗时约8分钟,时间主要消耗在视频解码和逐帧分析上。输出结果也不是干巴巴的文案提取,GLM-5.3-Flash展现了自身的思考和对视频的解读能力,每个步骤在逻辑上也站得住脚。
(三)代码慢成蜗牛?它直接给你三套优化方案
接下来我们将测试的目光转向算法工程领域。我们提供了一段经典的斐波那契数列计算代码(纯递归实现,输入n=40时耗时约12秒),并附上一句指令:“分析这段代码的性能瓶颈,提供优化方案,生成改进后的代码,并对比执行时间。”
让我们意外的是这次处理问题时间仅花费了35分钟,模型首先给出了详细的性能分析:递归版本存在大量重复计算,时间复杂度为O(2^n),调用栈深度过大。随后它主动提出了三种优化策略——记忆化递归(缓存中间结果)、迭代法(动态规划)、以及矩阵快速幂(适合大数)。
模型不仅生成了三种方案的Python代码,还主动编写了一个性能测试脚本,使用timeit模块分别测量各方案在n=40、n=100、n=1000下的运行时间。
我们执行了测试脚本,结果如下:递归版本在n=40时耗时11.8秒;记忆化递归仅需0.0003秒;迭代法耗时0.0003秒;矩阵快速幂在n=1000时仍能保持0.001秒以内。模型在输出中还附带了内存占用的对比分析和适用场景建议(如迭代法适合中等规模,矩阵法适合超大数值)。
更令人惊喜的是,模型主动指出原始代码中缺少输入校验,因此它在优化版本中增加了对负数及非整数输入的处理,并添加了详细的docstring和类型注解。
整体测试下来感觉GLM-5.3-Flash在代码理解、算法设计、性能工程和文档编写方面的综合能力,以及主动生成测试用例和多方案对比的行为,已经接近资深开发者的工作习惯。
(四)抓网页、做表格、写文案、生成卡片,一条龙
接下来的任务我们模拟真实的数字营销场景:为一个品牌制作竞品对比素材。我们随机在某手机测评平台挑选了四款竞品智能手表,详情页的本地网页中包含了图片、参数、评分,指令要求其生成对比表格,再撰写一段营销文案并输出朋友圈卡片HTML。
模型首先调用浏览器工具抓取页面,成功获取全部数据。
随后将产品信息整理成Markdown表格,并用加粗项标明了每个维度最强或者是最具差异化的卖点,这让人在众多数据中一眼就可以看到核心参数。
所生成的文案更像是种草文案,长度和语言风格都适合在朋友圈展示,而且也抓住了每个机型不同特点。
最后生成的卡片HTML采用1:1方形比例,GLM-5.3-Flash不仅提取了所有关键信息,而且整体卡片内容也很简洁。
上述测试从侧面看出GLM-5.3-Flash在结构化数据整理、文案创作、前端编码以及Agent闭环等能力都在逐步走向成熟。
(五)Three.js光点跑偏?它看了一眼截图就修好了
接下来的场景,我们想检验一下模型的3D生成能力,要求模型编写Three.js场景:旋转地球,在纽约、伦敦、东京、北京标注发光粒子并带有呼吸灯动画。遗憾的是,在首次生成代码运行后,页面没有出现任何画面,直接宣告失败。
于是,我们马上将运行结果反馈给模型。模型通过查看代码,虽然发现了问题,开始着手修正,但是第二次运行结果再次失败。在这种情况下,我们不得不进行第三次修正,终于在10分钟后运行成功。
(六)Blender生成室内场景,翻车了但没完全翻
最后一项是难度最高的Blender脚本生成任务:创建包含桌子、两把椅子、发光台灯、真实材质和摄像机环绕动画的室内场景。模型生成的初版直接连渲染都失败了。
我们将渲染结果截图反馈给模型,第二版修正后,结果不尽如人意,出现了桌面反射过强、背光阴影缺失的问题。第三版模型调整了粗糙度和背光位置,但同时也导致整体材质以及模型出了问题,以上问题在第三轮反复出现,最终未达到可用标准。
尽管失败,但模型已能生成部分正确的几何体和材质,并基于视觉反馈进行局部调整。结果显示,其瓶颈在于多物理参数(尺寸、光照、动画曲线)的联合优化。
三、“牛”来了,但路还长
把六项测试摊开来看,这头“牛”的能力边界比一串benchmark分数更具体。
前端审美是这次最大的质变。从仪表盘复刻还原,到Three.js场景的精准落点,再到社交媒体卡片的版式设计,它已彻底告别“AI前端一眼假”的粗糙感。
算法与工程同样扎实,斐波那契优化中主动给出三套方案并自动测试,交付即上线。跨应用Agent闭环跑通,四个环节无缝衔接,是“能连续干活”的样子。
问题也存在。Blender场景两次连锁错误,都发生在已接近正确的领域,多物理参数联合优化仍是难点,但是强如Opus 4.8也有类似失误,目前尚无完美解法。
至于“值不值”,以本次表现,即便优惠结束恢复标价,它依然极具性价比。
同时考虑到其定价仅为同级模型的1/40,对于绝大多数实际开发场景:前端原型、算法开发、数据报告、自动化营销、教育演示,它已足够好用且足够便宜。智谱通过稀疏激活架构,在成本与性能之间找到了一个极具竞争力的平衡点。
“牛来”确实来了,它不贵,而且已经在多个真实任务中证明了自己。那些暂时无法跨越的高墙,留给下一个版本去冲击。以当前迭代速度,也许那一天不会遥远了。
(本文全部实测于GLM-5.3-Flash上线当日完成,环境为官方在线体验平台。)
特别声明:以上内容仅代表作者本人的观点或立场,不代表Hehson财经头条的观点或立场。如因作品内容、版权或其他问题需要与Hehson财经头条联系的,请于上述内容发布后的30天内进行。