GLM-5.3-Flash实测:“牛来”掉马甲,价格屠穿DeepSeek
创始人
2026-08-27 21:25:00
0

来源:光子星球

就在今天凌晨,智谱的GLM-5.3-Flash模型正式上线并开源。

此前一周,它以Ox-Alpha的匿名身份在OpenCode和OpenRouter上公测,并迅速登顶双平台调用量榜首。社区赋予它中文名“牛来”,既呼应“牛市”寓意,也暗合Ox(公牛)的本义。

定价方面,GLM-5.3-Flash标价为GLM-5.3的1/10,限时优惠期内仅为1/20。按每百万token计,输入0.075美元,输出0.25美元。相比之下,DeepSeek-V4-Flash的最低输入价为0.22美元,输出0.66美元。GLM的输入成本便宜近3倍,输出便宜2.6倍。而与其性能同级的Claude Opus 4.8,定价则为GLM的40倍。

我们花费整整一晚,将模型接入真实开发环境,用一套面向实际工作流的测试方案进行实测。结论明确:原生多模态能力显著提升前端开发效率,Agent稳定性超出预期,但复杂3D场景仍存在瓶颈。

一、这头“牛”到底什么来头?

GLM-5.3-Flash属于GLM-5系列,是首个原生多模态模型。总参数量为320B,但每次推理仅激活18B(约180亿)参数,采用稀疏激活架构,在保持高性能的同时大幅降低计算成本。

关键规格:

上下文长度:1M token,可处理长篇文档、整部代码库或长时间视频;多模态能力:视觉编码器与语言模型深度耦合,能直接“看见”图像、截图、渲染结果,并基于视觉反馈修正代码;接口兼容:提供OpenAI格式API,可无缝接入各类Agent框架和工具链。

官方在Artificial Analysis Intelligence Index(AA 综合智能指数)中给出57分,与Claude Opus 4.8持平。在Terminal-Bench 2.1和DeepSWE基准上分别取得84.3和63.4分,高于DeepSeek-V4-Flash的82.7和54.4。

不过社区存在一些质疑声音,认为部分任务仍稍逊于Opus 4.8。因为官方未公开完整benchmark报告,所以我们决定亲自验证。

二、纸上数据很漂亮,社区为何吵翻天?

我们摒弃传统的单轮问答测试,转而模拟真实工作场景中的多步骤、跨工具任务。所有测试均在API环境下进行,模型需自主调用工具、处理多格式输入、并根据中间结果迭代修正。

测试共6项,难度递进,覆盖从设计稿到代码、从视频到文稿、从算法优化到跨应用自动化、从3D场景到视觉纠错等多个维度。

(一)草图扔进去,网页直接跑起来

这里我上传了一张网络安全大数据平台的仪表盘图片,在仅输入一句“根据图片生成一个可交互网页”的情况下,让我们看看5.3-Flash会有什么样的表现。

差不多5分钟后我们拿到了运行结果:除了部分UI一些细微的差别,在设计上的观感可以说是一模一样了,我们本以为这种看起来交互复杂的页面,还需人工再调整几次,但没想到一次就输出了不错的效果。

在原生多模态的“看图编程”方面,GLM-5.3-Flash确实可以将原型设计到初稿状态,同时其代码周期压缩到了令人难以置信的地步。

(二)5分钟的纪录片,文案精华搞定

接下来要测试视频理解能力,这里由于测试平台以及时间上限制,我们只选取了一个五分钟的纪录片作为素材,要求模型提取视频核心论点、关键数据和视觉元素,最后按“问题-论证-结论”的叙事结构重组,输出文案文稿。

测试结果显示,GLM-5.3-Flash生成的摘要并非简单截取字幕,而是将分散在不同时间点的三个实验案例串联成一个逻辑链条,这展示了它跨段落的语义理解和内容重构能力。

处理总耗时约8分钟,时间主要消耗在视频解码和逐帧分析上。输出结果也不是干巴巴的文案提取,GLM-5.3-Flash展现了自身的思考和对视频的解读能力,每个步骤在逻辑上也站得住脚。

(三)代码慢成蜗牛?它直接给你三套优化方案

接下来我们将测试的目光转向算法工程领域。我们提供了一段经典的斐波那契数列计算代码(纯递归实现,输入n=40时耗时约12秒),并附上一句指令:“分析这段代码的性能瓶颈,提供优化方案,生成改进后的代码,并对比执行时间。”

让我们意外的是这次处理问题时间仅花费了35分钟,模型首先给出了详细的性能分析:递归版本存在大量重复计算,时间复杂度为O(2^n),调用栈深度过大。随后它主动提出了三种优化策略——记忆化递归(缓存中间结果)、迭代法(动态规划)、以及矩阵快速幂(适合大数)。

模型不仅生成了三种方案的Python代码,还主动编写了一个性能测试脚本,使用timeit模块分别测量各方案在n=40、n=100、n=1000下的运行时间。

我们执行了测试脚本,结果如下:递归版本在n=40时耗时11.8秒;记忆化递归仅需0.0003秒;迭代法耗时0.0003秒;矩阵快速幂在n=1000时仍能保持0.001秒以内。模型在输出中还附带了内存占用的对比分析和适用场景建议(如迭代法适合中等规模,矩阵法适合超大数值)。

更令人惊喜的是,模型主动指出原始代码中缺少输入校验,因此它在优化版本中增加了对负数及非整数输入的处理,并添加了详细的docstring和类型注解。

整体测试下来感觉GLM-5.3-Flash在代码理解、算法设计、性能工程和文档编写方面的综合能力,以及主动生成测试用例和多方案对比的行为,已经接近资深开发者的工作习惯。

(四)抓网页、做表格、写文案、生成卡片,一条龙

接下来的任务我们模拟真实的数字营销场景:为一个品牌制作竞品对比素材。我们随机在某手机测评平台挑选了四款竞品智能手表,详情页的本地网页中包含了图片、参数、评分,指令要求其生成对比表格,再撰写一段营销文案并输出朋友圈卡片HTML。

模型首先调用浏览器工具抓取页面,成功获取全部数据。

随后将产品信息整理成Markdown表格,并用加粗项标明了每个维度最强或者是最具差异化的卖点,这让人在众多数据中一眼就可以看到核心参数。

所生成的文案更像是种草文案,长度和语言风格都适合在朋友圈展示,而且也抓住了每个机型不同特点。

最后生成的卡片HTML采用1:1方形比例,GLM-5.3-Flash不仅提取了所有关键信息,而且整体卡片内容也很简洁。

上述测试从侧面看出GLM-5.3-Flash在结构化数据整理、文案创作、前端编码以及Agent闭环等能力都在逐步走向成熟。

(五)Three.js光点跑偏?它看了一眼截图就修好了

接下来的场景,我们想检验一下模型的3D生成能力,要求模型编写Three.js场景:旋转地球,在纽约、伦敦、东京、北京标注发光粒子并带有呼吸灯动画。遗憾的是,在首次生成代码运行后,页面没有出现任何画面,直接宣告失败。

于是,我们马上将运行结果反馈给模型。模型通过查看代码,虽然发现了问题,开始着手修正,但是第二次运行结果再次失败。在这种情况下,我们不得不进行第三次修正,终于在10分钟后运行成功。

(六)Blender生成室内场景,翻车了但没完全翻

最后一项是难度最高的Blender脚本生成任务:创建包含桌子、两把椅子、发光台灯、真实材质和摄像机环绕动画的室内场景。模型生成的初版直接连渲染都失败了。

我们将渲染结果截图反馈给模型,第二版修正后,结果不尽如人意,出现了桌面反射过强、背光阴影缺失的问题。

第三版模型调整了粗糙度和背光位置,但同时也导致整体材质以及模型出了问题,以上问题在第三轮反复出现,最终未达到可用标准。

尽管失败,但模型已能生成部分正确的几何体和材质,并基于视觉反馈进行局部调整。结果显示,其瓶颈在于多物理参数(尺寸、光照、动画曲线)的联合优化。

三、“牛”来了,但路还长

把六项测试摊开来看,这头“牛”的能力边界比一串benchmark分数更具体。

前端审美是这次最大的质变。从仪表盘复刻还原,到Three.js场景的精准落点,再到社交媒体卡片的版式设计,它已彻底告别“AI前端一眼假”的粗糙感。

算法与工程同样扎实,斐波那契优化中主动给出三套方案并自动测试,交付即上线。跨应用Agent闭环跑通,四个环节无缝衔接,是“能连续干活”的样子。

问题也存在。Blender场景两次连锁错误,都发生在已接近正确的领域,多物理参数联合优化仍是难点,但是强如Opus 4.8也有类似失误,目前尚无完美解法。

至于“值不值”,以本次表现,即便优惠结束恢复标价,它依然极具性价比。

同时考虑到其定价仅为同级模型的1/40,对于绝大多数实际开发场景:前端原型、算法开发、数据报告、自动化营销、教育演示,它已足够好用且足够便宜。智谱通过稀疏激活架构,在成本与性能之间找到了一个极具竞争力的平衡点。

“牛来”确实来了,它不贵,而且已经在多个真实任务中证明了自己。那些暂时无法跨越的高墙,留给下一个版本去冲击。以当前迭代速度,也许那一天不会遥远了。

(本文全部实测于GLM-5.3-Flash上线当日完成,环境为官方在线体验平台。)

特别声明:以上内容仅代表作者本人的观点或立场,不代表Hehson财经头条的观点或立场。如因作品内容、版权或其他问题需要与Hehson财经头条联系的,请于上述内容发布后的30天内进行。

相关内容

热门资讯

长征五号B遥一运载火箭顺利通过... 2020年1月19日,长征五号B遥一运载火箭顺利通过了航天科技集团有限公司在北京组织的出厂评审。目前...
9所本科高校获教育部批准 6所... 1月19日,教育部官方网站发布了关于批准设置本科高等学校的函件,9所由省级人民政府申报设置的本科高等...
9所本科高校获教育部批准 6所... 1月19日,教育部官方网站发布了关于批准设置本科高等学校的函件,9所由省级人民政府申报设置的本科高等...
湖北省黄冈市人大常委会原党组成... 据湖北省纪委监委消息:经湖北省纪委监委审查调查,黄冈市人大常委会原党组成员、副主任吴美景丧失理想信念...
《大江大河2》剧组暂停拍摄工作... 搜狐娱乐讯 今天下午,《大江大河2》剧组发布公告,称当前防控疫情是重中之重的任务,为了避免剧组工作人...