千问3.8-Max发布:国产模型激战正酣,阿里如何突围制胜?

   时间:2026-08-04 22:20 来源:天脉网作者:沈如风

8月初,阿里正式推出Qwen3.8-Max大模型,参数规模高达2.4万亿,支持最长100万Token上下文,重点提升编程、办公、科研及长周期任务处理能力。官方宣称,该模型不仅能回答问题,还可调用工具、修改代码,并端到端完成复杂任务。开发者可通过千问AI平台获取API服务,每百万Token输入12元、输出36元,价格处于国产头部模型中间水平。阿里计划开源Qwen3.8系列的27B小尺寸模型,为本地部署和低成本应用提供更多选择。

在7月19日预览版上线时,千问团队便宣称该模型以“天”为单位持续进化,对标Anthropic旗舰模型Fable 5,并称其“可能是除Fable 5外最强大的模型”。然而,实际测试显示,Qwen3.8-Max在科研编程、Agent和办公任务中进步显著,部分项目甚至超越海外旗舰模型,但在真实软件工程和复杂环境操作中仍存在差距。例如,在SWE-bench Pro测试中,Qwen3.8-Max得分为67.7分,比Fable 5低12.3分,也略低于Claude Opus 4.8的69.2分。

第三方榜单Arena的成绩也反映了类似情况。Qwen3.8-Max在视觉和文本榜单上分别排名第二和第五,与榜首相差13分;在前端代码榜单中排名第四,比榜首的Opus 5-Max低37分。尽管官方编程基准成绩较好,但Arena榜单更侧重生成结果的视觉效果、交互完成度和用户偏好,因此Qwen3.8-Max未能登顶并不矛盾。长周期任务是Qwen3.8-Max的亮点之一,例如连续运行约16天从零构建开源项目oh-my-cli,但连续运行16天仍不足以证明长周期能力已完全成熟,还需考察其目标一致性、错误发现和恢复能力。

千问系列模型一直成绩亮眼。5月20日发布的Qwen3.7-Max曾在Code Arena排名第四,Text Arena排名第六。然而,实际使用中开发者反馈不一。开发者艾林认为,Qwen3.7-Max对项目理解清晰,但在处理复杂代码时易出现漏洞。新一代Qwen3.8-Max在任务拆解、Agent调用和需求理解上有所提升,但与Fable系列仍有差距。独立开发者李默测试后表示,Qwen3.8-Max已接近第一梯队门槛,但在生成交互网站时存在核心功能未完整实现、HTML标签直接显示等问题,需将要求拆解得非常具体才能执行到位。

与国内近期发布的新模型相比,Qwen3.8-Max在与Kimi K3的对比中,仅在工作流智能体任务上超过对方,其余项目多数落后,尤其在深度软件工程和前沿工程任务中差距较大。与DeepSeek V4 Flash的对比则更多反映定位差异,Qwen3.8-Max在所有可比项目中均占优势,但轻量模型V4 Flash以更低成本取得“够用”成绩,挑战了中间价位旗舰模型的价值。开发者李默认为,Qwen3.8-Max在长上下文和复杂任务上的提升“实打实”,但代码能力仍弱于GLM 5.2和Kimi K3,尚未稳定排进第一梯队前列。

阿里面临的竞争环境愈发复杂。过去,架构创新、更长的上下文或更低的API价格可能成为模型卖点,但如今这些能力正在快速普及,MoE架构、百万Token上下文、智能体编程、多模态和开放权重几乎成为国产头部模型的共同方向。对手动作也越来越快,Kimi K3在复杂软件工程和长周期任务中表现突出,DeepSeek V4以低价和推理效率吸引开发者,GLM 5.2则凭借编程能力获得海外开发者认可。技术路线趋同下,单个模型难以建立长期壁垒,竞争转向谁能持续推出更强模型并降低推理成本。

API定价策略反映了四家的不同思路。Kimi K3走高价旗舰路线,DeepSeek V4-Pro用低价争夺调用量,Qwen3.8-Max与GLM 5.2处于中间档位,但千问输入、输出价格均高于智谱,不占价格优势。对于编程和Agent任务,Token单价只是成本一部分,任务成功率、重试次数和人工接管成本往往更影响总成本。低价模型若频繁理解错需求,节省的调用费用可能被检查和返工成本抵消;高价模型若能一次完成任务,综合成本反而可能更低。因此,Qwen3.8-Max需证明其完成同一项任务时能带来更低综合成本。

阿里的独特优势在于模型之外的完整生态。在模型层面,阿里已覆盖通用语言、编程、数学、视觉、语音、全模态和视频生成,并延伸至世界模型和具身智能,企业可在同一平台组合不同模型。在产品层面,阿里拥有云计算、模型开发平台、钉钉、淘宝及大量企业客户,模型可直接接入办公、电商、客服、营销和软件开发场景。发布当天,阿里旗下企业级Agent产品“千问办公”同步开启公测,模型能力正被直接装进办公场景。阿里披露,Qwen在国内企业级大模型调用市场排名第一,阿里云也位居国内AI云市场第一。然而,生态不能替代模型能力,企业倾向于在同一系统中调用多个模型,哪个效果更好、价格更低就用哪个。若千问长期落后于第一梯队,云和渠道只能延缓用户流失,无法消除能力差距。阿里的竞争力仍存在,但壁垒已非某一款Qwen模型,模型能力决定入场资格,价格决定开发者尝试意愿,云服务和企业生态则决定客户是否长期留下。

 
 
更多>同类内容
全站最新
热门内容