国产大模型ClaudeCode编程能力测试!
2025-12-24 14:03 浙江

含GML、qwen、DeepSeek、MiniMax-M2测试
测试环境
claude code版本: v2.0.37,为规避历史记录影响,每次执行完以后删除掉.claude目录,重新创建。为保证结果不受其他因素干扰,均只设置最基本的环境变量

提示词: @index.hmtl 将同一家厂商的模型,放到同一行中
测试时间: 2025/12/24
原始index.html文件效果
需要源码自己复现测试的,文件来源是 https://llm.minprices.com/
文本长度17k,在各个模型上下文的舒适区:

考察点:
•能否实现需求•侵入性,如果原本布局被修改视为侵入性过强
DeepSeek
计费模式: API按量付费

进入了先规划后修改的模式


整体用时5分钟左右,修改完成。
页面效果符合需求

花费 0.25元

实现方式: 通过修改原始数据遍历的函数实现

GLM
计费模式: API按量付费 OR 开发者计划
部分情况下,是直接开始改代码

用时1分钟20秒左右,完成了需求,但是原本表格样式被破坏。不符合需求

GLM 2测 : 依然破坏了格式


实现方式和DeepSeek差不多

MiniMax-M2
计费模式: API按量付费 OR 开发者计划
先规划后行动


整体用时: 2分钟左右,满足需求,符合预期。

M2的实现方式是通过,通过js新增函数来进行分组实现

qwen
qwen在未指定模型的情况下,无法通过默认配置使用claude code


消耗token:438895,不及格
结论
在这个测试案例中
MiniMax-M2 解耦和略好于 DeepSeek
GLM、qwen不及格
低频使用推荐使用DeepSeek,每次1-5毛钱
高频使用推荐MiniMax-M2 开发者计划 ¥29 /月 ¥290 /年