快科技8月14日消息,CLUE团队发布了SuperCLUE-Terminal中文智能体终端编程测评榜单,新版DeepSeek-V4-Pro-0813获得51.52分。
这一成绩在全部参测模型中位列第二,仅落后于Kimi-K3,同时其调用成本极低,性价比优势相当明显。
SuperCLUE-Terminal是一套专为国内开发者设计的实战评测体系,所有题目均取材于本土真实编程任务,并统一以Claude Code作为运行框架,从而公平比较各模型在理解中文需求、规划任务、调用工具、排查错误及修改代码等方面的综合能力。
每道考题要求模型完成50至110轮交互,单题完整运行时间从半小时到一个半小时不等,能够较为真实地还原日常开发中的复杂工作流程。

在本期榜单中,Kimi-K3以60.61分位居榜首,DeepSeek-V4-Pro-0813紧随其后,其分数高于GLM-5.2的48.48分以及旧版DeepSeek-V4-Flash的46.46分。
最引人注目的是其成本控制表现,单题调用费用仅为1.42元,大约是Kimi-K3的十四分之一、GLM-5.2的十六分之一。
测评场景覆盖了前端页面开发、3D游戏制作、工程脚本修改等实际需求。在实测过程中,该模型能够完整闭环游戏开发逻辑,碰撞检测、计分、结算等功能均运行正常,页面配色与交互反馈也摆脱了模板化的AI风格;仅在少数创意绘图类题目中会出现轻微的结构瑕疵,但整体完成度仍处于第一梯队。
对于中小企业及独立开发者而言,这款模型在性能与开销之间取得了良好平衡。头部高分模型的算力成本偏高,小规模团队长期使用负担较重,而DeepSeek-V4-Pro-0813以更低的价格接近了顶级代码能力。

【本文结束】如需转载请务必注明出处:快科技。
责任编辑:随心。