|
8月14日,智谱正式发布大模型 GLM-5.3。基座参数量仍然是7400多亿,跟 GLM-5.2同一套底子,此前传闻的万亿参数升级并没有出现——那枚牌大概被留给了 GLM-5.5。但智谱靠着后训练这招,硬是让 GLM-5.3的性能比上一代提升了50%,在多项主流基准测试中拿下了当前开源模型最高排名,编程与智能体能力接近 Claude Fable5,编程体感超过其他国产模型。 几项关键基准的成绩跃升很有说服力。在衡量模型于真实终端环境中完成复杂任务的 Terminal-Bench3.0上,得分从4.6一口气蹿到28.3;聚焦长程软件工程与持续代码修改能力的 DeepSWE v1.1,从46.2涨到66.9;覆盖多类真实专业场景、强调跨工具协作与长程任务的 Agents' Last Exam,从23.8提升到28.5。在覆盖44种职业、考察真实高价值知识工作的 GDPval-AA v2中,GLM-5.3拿到1769分,展现出基于编程能力涌现出的专业任务执行力。整体来看,它在复杂软件工程、终端操作和更广泛的真实世界 Agent 任务上都有显著进步。
https://www.chinaz.com/ainews/30353.shtml
|