模型竞争态势初现Anthropic 亮出“最危险”的模型 Mythos 时其 CEO、坚定的反华头子 Dario Amodei 判断中国模型追上这类能力还需 6 至 12 个月。但后来智谱反手推出 GLM-5.2 追赶编程前沿Kimi 又拿出 2.8 万亿参数的 K3华尔街一度重演“DeepSeek 时刻”。紧接着阿里巴巴推出了 2.4 万亿参数的 Qwen3.8-Max-Preview按官方说法其综合性能仅次于 Fable 5在全栈开发、数据分析和 Office 工作流中已能对垒前沿模型。测试背景与目标Qwen3.8-Max-Preview 能把中国开源模型叙事讲下去么决定让近几个月三款旗舰级的中国开源模型 GLM-5.2、K3 和 Qwen3.8-Max-Preview 一起合作开发正在改版的硅星人/品玩新网站。为弱化 Harness 的影响工作方式采用了“模型 opencode”的组合。值得指出的是正在改版的硅星人网站是个半成品网站项目已包含 Next.js 前端、Payload CMS、Anime.js 页面动效等也积累了现成的设计规范、历史代码和工作文档。不过这个网站问题很大历史上多次进行前端和后台的开发和维护屎山代码堆积结构臃肿前端交互混乱、虚假的不可用的功能很多前端和后端 bug 交缠在一起是糟糕的网站开发范本必须被改变。对模型来说空白项目没有历史包袱和屎山代码往往可以自如发挥而半路项目通常是模型最严厉的“父亲”它要求模型看得懂项目在当下状态还要在不破坏现有功能的情况下进行精确的修改属于屎上雕花的高难度操作。测试项目及结果项目进展分析这次网站改版眼下需要解决六个问题先测试谁看懂了项目当前的进展。结果是 No.1 Qwen 3.8-MaxNo.2 Kimi K3No.3 GLM 5.2。这轮对应网站改版的第一个诉求是分清“现在有什么”和“文档里曾经想做什么”。接手半路项目最怕模型把旧文档当成当前需求把已经完成的功能重新做一遍。所以没立刻让三个模型修改代码而是先让它们分析项目看看谁能更快摸清现状。从生成速度来看Qwen 3.8-Max-Preview 最快10 秒内解决其次是 GLM-5.2最后是 Kimi K3。三个模型像不同风格的开发者GLM-5.2 像经验丰富的老师傅准确地找到了 14 个 CMS 集合、Payload 版本锁定和数据库检查机制对项目底层结构的理解最深但把四月份的旧方案也当成了当前施工计划将全文搜索列为待办事项实际上搜索、筛选和结果高亮早已完成。Qwen 3.8-Max 更像每天待在现场的监工生成速度最快也最准确抓住了项目最近在做什么。Kimi K3 则像一个一分钟带你看完房子的中介用很短的篇幅讲清楚了房间布局但把 14 个 CMS 集合数成了 15 个还把隔壁的工作记录文件夹介绍成了“文档仓库”。在搞清现阶段需求上Qwen 3.8-Max 得分最高全貌感略欠但最快也最精准地找到了问题。其次是 Kimi K3它知道自己要做什么但速度太慢了它看得到全局但太粗心了经常嘴瓢说错。而 GLM 5.2 把旧文档当成了当前需求把已经完成的功能重新做了一遍属于搞不清楚状况。解决网站报错这轮对应第二个诉求模型能不能把诊断变成行动。启动前端页面却没同时打开 CMS因此网页出现报错把报错信息直接交给三个模型处理。三个模型都定位到了问题但后续动作明显不同。Qwen 3.8-Max 快人一步直接帮启动了 CMS。Kimi K3 只给出解决方案并没有实际执行。GLM-5.2 的处理速度较慢等它准备启动 CMS 时公共端口已经被 Qwen 3.8-Max 占用于是它直接复用了 Qwen 3.8-Max 启动的服务。在报错需求解决上Qwen 3.8-Max 仍然排名第一它启动了 CMS而且最快。GLM-5.2 排第二慢了一步但它发现端口被占后选择复用已有服务这是正确且成熟的工程判断。而 Kimi K3只交方案不动手只能排第三。轮播图效果实现把三个模型切换到独立端口测试它们精确修改前端的能力。首先是快讯板块希望它实现自动轮播和无缝循环但现有动效会让卡片逐张向左平移播放到最后一张时再让整个列表向右滑回开头。promtps 要求修改首页“此刻发生”板块实现无缝无限轮播所有卡片持续向左移动第 08 张卡片移出后第 01 张卡片从右侧自然接上循环播放不能在播放到最后一张后让整个列表向右滑动返回开头循环衔接时不能出现停顿、跳动或空白只修改前端轮播效果不修改数据和后端。结果三个模型最终或多或少都有些问题。Qwen 3.8-Max 自作主张删除了鼠标拖动功能严重扣分它用长度伪装成循环只在表面上实现了循环联播播放到最后一轮时卡片仍然会重新跳回开头。Kimi K3 把直线跑道改成了环形却删掉了自动轮播功能用户只有拖动鼠标卡片才会继续前进而且在动画细节上不够精细画面会跳帧。GLM-5.2 实现得最完整既保留了自动轮播也支持鼠标拖动还能持续循环但和 Kimi K3 存在同样的问题旧卡片消失得太快循环衔接时仍然会突然跳一下离真正的无缝循环只差最后一点收尾。GLM 5.2 可以排第一它是唯一一个功能清单完整的但需求解决未完整达标。Kimi K3 把最难的部分做对了但删掉自动播放和衔接跳帧是个诚实的半成品可排第二。Qwen 3.8 Max 问题严重删了鼠标拖动自作主张改了需求其方案是伪装出来的而且架构上是死路要真正实现无缝循环就得推倒重来。修改现有功能修改了“最新观点”部分的强调色和卡片动效prompts 要求修改首页“最新观点”板块将强调色改为科技蓝#3157FF应用于栏目标题、序号和悬停状态卡片增加浅蓝色边框和圆角鼠标悬停时轻微上浮、边框变蓝其他布局和内容保持不变只改前端。这项测试考察的不是模型能不能认对颜色而是修改范围是否完整、一致。任务实际涉及标题、序号、卡片背景、边框、圆角和鼠标悬停状态等页面里还有多种变体任何一处遗漏都会让新旧两套设计同时出现在用户面前。Qwen 3.8-Max 的修改速度最快文字颜色、背景颜色、边框和圆角基本都处理正确但鼠标悬停后的交互色仍然是绿色没有同步改成蓝色即没有修改交互层的颜色。Kimi K3 这一轮问题很大它修改了边框、圆角和其中一处颜色其他部分几乎没有变化。GLM-5.2 没有直接修改代码而是先问了两个问题明确询问过的部分完成得不错未被方案覆盖的地方却出现了遗漏最大卡片的鼠标悬停颜色仍然是绿色只有小卡片变成了蓝色下方没有图片的卡片交互颜色也完全没有修改。这一轮Qwen 3.8-Max 的整体完成度最高尽管漏掉了悬停色的修改。GLM-5.2 在已经确认的范围内做得更细事先确认范围的动作很重要但它的执行背叛了它的流程问到的地方做得漂亮没问到的地方彻底放飞了。相比之下Kimi K3 不得不垫底它明显没有吃透任务只动了边框、圆角和一处颜色。考验模型审美前两轮考验的是精确执行这一轮把问题反过来不给参考答案让模型自己做审美判断。让三款模型重新设计首页 Hero 区域promtps 要求体现科技媒体的专业感、前沿感和编辑气质保留现有标题、文案和按钮但可以重新设计排版、字体层级、留白、色彩和动效标题应成为第一视觉焦点整体要有鲜明风格但不能做成常见的科技公司官网模板避免霓虹渐变、玻璃拟态、粒子背景和过多装饰动效应克制、流畅并适配桌面端和移动端只修改 Hero 区域前端不修改导航栏、其他板块、内容数据和后端。Qwen 3.8-Max 采用了粗体极简风超大的黑色无衬线标题被分成三行占据页面左侧的主要空间背景几乎没有装饰只用短横线和文字链接建立层级整体更接近现代媒体首页视觉重心完全落在标题上。Kimi K3 采用了科技极简风标题同样使用粗体无衬线字体但增加了背景层次左侧承载文案和蓝色按钮右侧加入网格、细线与柔光组成的背景动效相比 Qwen 3.8-Max它使用了更多科技蓝和几何元素。GLM-5.2 采用了杂志编辑风标题被改成超大衬线斜体并加入 EDITORIAL、EDITION 2026、01 FEATURE 等期刊元素页面通过细分隔线、大面积留白和底部滚动提示形成了类似纸质杂志封面或专题头版的视觉结构。这一轮很难选出唯一赢家Qwen 3.8-Max 最像现代内容媒体Kimi K3 的科技感最强GLM-5.2 则最有杂志封面的编辑气质。它们也暴露了三种不同的理解Qwen 3.8-Max 认为科技媒体首先是媒体Kimi K3 认为科技媒体首先要有科技感GLM-5.2 则把重点放在“编辑”两个字上。而且可以看出K3 在前端动效上有主动性而 Qwen 3.8-Max 和 GLM-5.2 就不会主动加动效。如果按对硅星人自身的理解给 K3 排第一它的前端审美有口皆碑且认为“科技感”是第一属性切中要义。第二给到 Qwen 3.8-Max尽管认为硅星人是媒体但好歹是个现代内容媒体的风格。只好给 GLM 5.2 排第三。增加快速审核功能改完前端进入 CMS。目前文章审核只能点进文章逐篇查看修改的目标是重新组织审核流程列表要集中展示待审核文章详情要在当前页面展开正文要能直接预览操作完成后还要同步更新文章状态和待审核数量。promtps 要求完善 CMS“审核工作台”集中显示所有待审核文章并展示标题、作者、提交时间和当前状态点击文章后从右侧展开详情面板显示文章摘要、正文预览及相关信息不跳转页面详情面板提供“审核通过”和“驳回”操作通过后文章进入待发布状态操作成功后立即更新列表和待审核数量。出乎意料的是这一轮最先完成任务的居然是 Kimi K3一改此前在前端任务中速度最慢的表现。很难据此判断 Kimi K3 是否真的内化了更多前端设计经验但至少可以确定一件事模型速度不是固定属性它会随着任务类型发生变化。从结果来看Qwen 3.8-Max 的侧边详情最完整标题、作者、提交时间、状态、分类、摘要和正文预览全部出现底部也能直接执行“审核通过”或“驳回”整体最接近 Prompt 要求。Kimi K3 的基本信息和操作功能比较齐全但正文预览过于简化用户仍然需要跳转到编辑页才能查看完整内容没有完全满足“不跳转页面查看内容”的要求。GLM-5.2 提供了摘要和固定操作栏但正文预览区域主要被一个巨大的图片加载失败占位覆盖审核人员很难从中获得有效信息是三个结果中偏离 Prompt 最明显的一个。这轮 Qwen 3.8 - Max 排第一Kimi K3 排第二GLM 5.2 完成度比较低排第三。模型综合表现总结几轮测试做完没有一款模型能够从头赢到尾。不过Qwen 3.8-Max 至少在这次测试中延续了 Kimi K3 和 GLM-5.2 带来的热度。Qwen 3.8-Max 优势是快而且对项目当前状态更敏感它最先完成项目分析最先启动 CMS在“最新观点”和“审核工作台”两项任务中也交出了完成度最高的结果对于希望尽快看到可运行版本的用户来说这种执行力很有吸引力。但它的缺点同样来自这种快为了实现轮播删除了原有的拖动功能又用复制大量内容的方式伪装无限循环。GLM-5.2 更像一名喜欢先读完资料再动手的工程师它对代码结构理解最深轮播功能完成得也最全面Hero 区域的杂志编辑风格最有辨识度。不过它速度较慢也容易被旧文档和自己的分析牵着走。Kimi K3 带来了最多的意外分析项目时最简洁数字错误也最多修改前端时经常漏掉关键要求却在 CMS 任务中第一个完成它有时像一个灵感很好的设计师有时又像一个没有耐心做完检查的实习生。这次测试的结果很难压缩成一个简单排名如果用最朴素的名次积分第一名 3 分、第二名 2 分、第三名 1 分叠加结果仅供参考它仅仅是在重构/改造硅星人网站这一个项目上的具体表现不代表模型的综合和整体性能。