7月19日,阿里千问在X上发了一条推文。
「Qwen3.8即将推出并开源权重,凭借庞大的2.4T参数,我们相信它是当今最强大的模型之一,仅次于Fable 5」。
一句话,两个信息:第一,2.4万亿参数;第二,全球第二。但你翻遍这条推文的评论区、Qwen的GitHub仓库、官方博客、阿里云开发者社区,找不到任何一张benchmark对比图。没有MMLU分数,没有SWE-bench排名,没有Arena Elo,什么都没有。
一个号称「仅次于Fable 5」的模型,却没有公开任何性能数据。这就很有意思了,所以我们干了件最简单的事:自己测。
官方说了什么?
先看看阿里官方到底公布了哪些信息。
在阿里云开发者社区的文章里,Qwen3.8被描述为一款「2.4T参数级全模态旗舰预览模型」,原生支持文本、图像、视频、文档处理,128K标准上下文窗口,可拓展至1M token。相比前代Qwen3.7-Max,「实现全方位跨越式升级」。
听起来很美好,但仔细读完整篇文章,你会发现一个规律:所有的性能描述都是定性的,没有一个是定量的。
「综合编码实力远超前代版本,达到行业顶尖水准」,具体在哪个benchmark上超了多少?没说。
「长周期智能体自治能力大幅强化」,跟谁比?强了多少?没说。
「综合实力比肩全球前沿顶级AI模型」,哪个模型?差多少?还是没说。
整篇文章最精确的数字,是定价:日间1折,夜间0.2折。这不是技术发布,这是营销文案。
阿里自己也说了,这是个预览版,模型「将以天为单位快速进化」,翻译成人话就是:后训练还没做完。
所以核心问题就变成了:这个没做完的预览版,到底能用吗?既然官方不给数据,我们自己测。
我们测了什么
我们设计了5项测试,按场景分类:
01-03:编码与Agent核心能力,验证官方主打的强项。04:3D浮岛创意项目,用GPT-5.6和Kimi K3的同一道题,原题复现,看编码能力的天花板。05:深度分析写作,看看非编码能力到底是不是短板。
测试平台是Qoder,模型版本Qwen3.8-Max-Preview。所有测试都是首轮结果直接记录,不修不改。
基础编码:够硬
第一道题是LRU Cache,用Python实现,要求O(1)时间复杂度,附带5个测试用例。
Qwen3.8选了哈希表加双向链表的组合,技术选型没有问题。代码直接复制到本地就能跑,5个测试用例全部通过。数据结构严密,边界处理也到位,比如key不存在时返回-1。对于基础算法题,没什么好说的,过了就是过了。
全栈开发:14个文件,一把跑通
第二道题是完整Todo应用,前端React加TypeScript,后端Flask,前后端对接完整,再加启动说明,一次性给出所有文件。
Qwen3.8生成了14个文件:11个前端组件加配置,2个后端文件,1个README。npm install之后前端正常启动,Flask后端也跑起来了,前后端对接没有问题。
UI这块,说实话比预期的好。简洁的现代风格,鼠标悬停的过渡动画做得挺到位,筛选功能的交互逻辑也正确:全部、已完成、未完成三个Tab切换流畅。
有个细节,前代Qwen3.7系列在HN上被用户评价为「完全不可用」,理由是「偏离轨道、死循环、无法调试」。从3.7到3.8,至少在Todo这种中等复杂度的全栈项目上,进步是肉眼可见的。
Agent任务:Cowork确实是真本事
第三道题是官方最引以为傲的Cowork场景,给Qwen3.8一个真实的GitHub仓库链接,让它先分析结构,再找3个bug,最后给出修复方案。
我给的仓库是GangBeng,一个相对小众的Python做的拼豆网站项目。
第一步分析仓库结构,模型正确识别了项目的主入口、核心模块、配置文件和依赖关系,没有胡编。第二步找bug,提了3个问题:一个资源泄漏,一个异常处理缺失,一个类型推断问题。逐个验证了一下,都是真实存在的。
然后我让它把仓库克隆到本地,按方案修复bug。它完成了,修复后的代码能成功运行。
结合起来看,Qwen3.8在编码和Agent任务上的表现是扎实的。基础算法能过,全栈项目能跑,Agent也能多步执行。至少在纯编码场景下,「仅次于Fable 5」的差距可能没有想象中那么大。但真正的好戏,在下一道题。
3D浮岛:翻得很彻底
这是文章最核心的一个对比。
两周前我们测GPT-5.6的时候,用了一个3D浮岛创意作品集的Prompt。完整的技术栈:React加Three.js(React Three Fiber),要求程序化生成浮岛、滚动驱动相机叙事、Bloom后处理、交互物件、性能优化,难度标签是四星。
GPT-5.6 Sol当时的成绩:功能完整度18/20,大部分Prompt要求都实现了,甚至自动加了背景虚化这种没要求的细节。GPT-5.6 Luna虽然最便宜,至少逻辑是对的,转场也还在。GPT-5.5虽然颜色审美一言难尽,但镜头推拉和物件交互都能正常运作。
甚至在后续给Kimi K3的时候完成的比GPT要更好。
同一道题,同样的Prompt,给了Qwen3.8。
跑起来了,npm install没报错,npm start也启动了。岛确实浮在空中,有几棵树,有些草,有个岛的模样,静态场景还算能看。
但到此为止。
四个滚动章节?没有镜头变化。相机只是在原地不动,你滚你的,它看它的。展示物件倒是摆了三四个,但鼠标悬停不发光,点击不拉近视角,emissive增强完全没生效。Bloom后处理在哪里也不知道。萤火虫粒子没有,云雾淡出也没有。
测试过这个Prompt的6个模型里(GPT-5.5加5.6三个变体,Kimi K3,Qwen3.8),Qwen3.8的成品是最差的一个。这不是「审美不好」的问题,是逻辑都没有跑通。GPT-5.6 Luna再简陋,至少把滚动驱动的框架搭出来了,物件能交互,相机能动。Qwen3.8只完成了3D场景的静态渲染部分,剩下所有涉及动效和交互的需求,基本没做。
这完美解释了为什么阿里自己不提非编码能力。3D场景的动效和交互需要的不是纯粹的代码逻辑,而是对视觉效果、用户体验、设计品味的综合判断。这部分能力,恰好是后训练还没覆盖到的。
非编码写作:意外的亮点
但最后一题,画风突变。
我让Qwen3.8写一篇1500字以上的分析文章,主题是2026年上半年中国AI大模型密集发布潮。同样的Prompt,之前让GPT-5.6跑过,结果是一篇典型AI文:每段只有一句话,满篇「不是而是」句式,读到一半就想关。
Qwen3.8这篇,不能说惊为天人,但至少有模有样。段落结构合理,论证有层次,从资本驱动、技术追赶、市场需求三个角度拆解了密集发布潮的原因。引用的数据大多是真实的(抽查了两个数据点,都能搜到原文)。最关键的是,没有那种「值得注意的是」「不可否认」「综上所述」的AI套话味。
分析深度打个4分,比GPT强,比Fable 5还是有差距,但考虑到这是以编码为主打场景的模型,文章质量已经超出了预期。
这个结果其实有点意外,非编码能力是Qwen3.8明确承认的弱项,但具体到中文长文写作这个子场景,表现反而不错。可能的原因:中文写作的训练数据本身就有优势,而且这个任务不涉及复杂的逻辑推理或多模态处理。
所以Qwen3.8到底排第几?
回到文章标题的问题。要给出一个诚实的排名,得分场景来看。
纯编码场景下,Qwen3.8跟Kimi K3同一梯队,跟Fable 5的差距在10几个百分点左右,属于「同一级别但略弱」的范畴。考虑到当前预览版近乎免费的定价,性价比极高。如果你的工作流以写代码为主,它完全够用。
Agent任务上,Qwen3.8的表现甚至可能是这个价位上最好的选择。我们的实测中,Cowork场景的多步自主执行确实靠谱,从分析仓库到修复bug全程没有断链。
但如果你需要创意编程、3D可视化、前端动效这类编码加审美的复合型任务,现阶段Qwen3.8还差得远。不是参数不够,是后训练还没做完。你用它能搭出一个功能完整的全栈应用,但不要指望它能生成一个让你「卧槽」的3D场景。
至于「仅次于Fable 5」这个说法,在编码维度上基本站得住,但在全面评测的场景下,水分不小。没有公开的benchmark数据、没有技术报告、没有模型卡,只靠一条推文和一篇营销文案立Flag,这种发布方式本身就说明:阿里自己也知道,东西还没做完。
正式版预计一个月后发布,届时会开源。如果后训练能补上非编码能力这块短板,定价保持目前策略,Qwen3.8确实有机会成为Fable 5之外最实用的选择。
但不是现在。
这件事还有一层更大的背景,就在Qwen3.8发布的同一周,Kimi K3(2.8T)和DeepSeek V4也相继亮相。三天三连发,全部逼近或突破2万亿参数。
中国模型在参数规模上已经不输硅谷,性能差距收窄到个位数百分点。但Qwen3.8这次「裸奔式」的发布,有参数没数据,有口号没证据,暴露了一个问题:造出大模型的能力是有了,但把模型打磨到能拿上台面接受公开审视的能力,还在路上。
预览版也好,限时1折也好,本质上是一次大规模公测,阿里需要用户反馈来完成最后那一轮打磨。
而我们这些用户,就是打磨过程中的小白鼠。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给个星标⭐~
谢谢你看这篇文章,我们,下次再见。
>/ 作者:高晓阳