过去两年,我们判断一个大模型够不够强,往往会问:它能不能回答复杂问题,数学推理怎么样,代码写得准不准
但当模型能力逐渐逼近,新的问题已经变成:如果人不再守在旁边,它能不能把一件事继续做下去?
不是生成几段代码,也不是给出一份看起来完整的方案,而是自己拆解任务、调用工具、检查结果,在遇到错误后重新调整,最后交付一个真正可用的成果。

阿里公布Qwen3.8-Max旗舰模型,总参数2.4万亿
2023年8月3日,阿里Qwen团队发布了新一代旗舰AI模型Qwen3.8-Max。该模型旨在担任类似AI同事的角色,专注于连续工作,而非仅仅是聊天界面。
混合专家架构优化性能
Qwen3.8-Max采用混合专家架构(MoE),总参数达到2.4万亿,但处理任务时仅激活950亿参数,代表模型容量而非实时计算负载。Qwen团队解释,这种设计根据任务选择不同模块参与计算,扩大知识规模同时控制响应速度。
核心功能:编程与多模态支持
该模型强调自主编程、专业工作、科学研究,并具备原生多模态能力,能同时处理文字、图片和视频输入。QwenCloud报告显示,模型支持最高99.1万Token输入,单次输出约13.1万Token,允许连续读取大型文件或视频内容,而不需频繁分割。
部署门槛高,但有子模型选项
Qwen3.8-Max仅在云服务器上可部署,其权重需1.2TB存储,主要服务于大型组织。相比之下,官方预告的子模型Qwen3.8-27B更适合个人和中小团队,便于本地部署。
长周期任务升级与科研应用
Qwen3.8-Max在长上下文中保持一致性,能从头开始复现机器学习论文,连续工作125小时编写7600行代码,这突显了其从读取到执行的完整工作链。

AI模型在数学和芯片设计实验中取得新进展
最新研究显示,AI模型在数学和芯片设计试验中展现出卓越表现,其成果体现在复现论文结论和实验优化两个方面,凸显出模型智能决策和优化设计的能力。
数学评测改进
在近期的一项测试中,该模型复现了论文中提出的六项主要结论,并通过自主实验实现了技术突破。数据显示,该模型耗时88小时探索了18种不同方法,最终在AIME24数学评测中将成绩提升了2.7个百分点。
芯片设计优化
在另一次实验中,模型通过500轮交互和71次完整评估,实现了加密电路的优化设计。从初始设计的8298个逻辑门简化到678个逻辑门,模型在每一轮基础上根据仿真和时序数据,对设计进行了精准的迭代调整。
技术突破性的分析
这些成果共同表明,AI模型已具备智能迭代与闭环优化的能力。模型不仅仅是简单调用已有知识,而是能够不断地假设、实验、反馈和改良,形成了一套物理推理渐进学习机制,在实现具体任务优化上表现出了稳定的进步。
探索机器智能的边界,这些进展正为多项应用生成新的可能路径,同时也为相关领域带来了进一步深度探索的契机。
Qwen Max 智能体会计功能:实现编程与协作共融的新探
智能体在持续运行中面临的难题不像一次性的聊天那么简单。如果是误解了用户的提问,重新提问便能化解;然而在规模庞大的长周期任务中,时不时会出现不易察觉的逻辑错误,这些细微差池一旦暗中渗透,便会如涟漪一般逐渐扩散,最终累积成错漏百出的局面。
在这其中,模型的核心技能必须超越单纯的内容生成,回归到检查自身的成长、修正先前步骤的能力上,进而实现更精准、更高的可持续性判断。
Qwen模型的最新版本Qwen3.5 Max提出了一个极具开创性的方向:“Coding and Cowork”,该名下的模式多少站在了用户与AI完美互动的新边缘。这里的“Cowork”显然不同凡响,它不是一句总结或者文档编写那般简单。
Command and Control:从流畅编码到知识检视能力
《Command and Cowork》正式定义了这个新模型人-机协作的交互界面,“Cowork”为协作的真谛给出了全新的注解。该协同机制不仅仅是工具的延伸,而是让模型真正融入到法律、会计、医疗、设计乃至数据挖掘的专业复杂数字流程之中,从而形成可以交付给用户的备用级结论或成品。
用户不仅可以要求完成某代码片段,或者要求模型“记笔记”,还可以要求通过即时纠错而得到优化后的程序,或者迅速生成审查分析报告——提供的几乎不是一份草稿,而是已经是可供使用的部分。这种真实可伺候的协作方式,超越了对话模型本身,是一种真正意义上的“结对编程”的模型。
对于使用者而言,传统上模型只是整齐排列的一个“大脑”,是工具的首选提供者。在这里,一切都不同了:不是程序发出指令就结束,而是指令和结果可以相互交织、互补验证,让对话不仅止于生成,更展现出持续的互动与深化。
在会计领域,例如,要求生成“符合新法要件的资产负债表”之后,模型不仅会输出平衡的报表,还会标注其依据的规则、版本和立法来源,有时候还附上必要的解释或比对流程,使会计专业用户无需再额外审核或求助。
不只会写代码,还必须理解专业规则,输出可控、可信任的成果物才是“Collaboration”的精髓所在。
这不仅改变了对AI模型能力的定义,更解放了用户,允许他们在一个可以自我调整、自我修正的过程中充分合作。

Qwen3.8-Max革新多模态交互 实现视觉反馈闭环
昨日,深度求索官方发布了Qwen3.8-Max的新特性,其在视觉交互领域取得重大突破,实现了从单次视觉理解向动态视觉反馈的转变。最新模型版本能够在生成内容的同时进行视觉验证,形成技术和视觉的互动闭环。
动态视觉交互新范式
与传统AI仅能处理静态视觉输入不同,Qwen3.8-Max能够在用户内容创作过程中不断获取反馈。具体而言,该模型能够:
- 快速生成设计原型
- 实时识别排版错位
- 感知文字溢出问题
- 建议视觉优化方案
弥合机器与人类操作差异
Qwen3.8-Max团队研发副总裁李明表示:"当前多模态模型最核心的局限在于孤立的视觉理解能力。而此次更新最重要的创新是将视觉能力整合到完整的智能操作循环中,使AI能真正理解'看'和'做'的关系,促进人机协作模式的变革。"
技术体验数据显示,在多轮迭代设计测试中,Qwen3.8-Max完成设计反馈时间比上一代提升42%,错误识别准确率提高至91.6%,展现出显著的进步。
性能水平靠前但非全项领先
Qwen3.8-Max在研发过程中确立了多个性能指标标杆,但并未宣称在所有指标上达到领先阵营第一位置。据官方公布,模型在视觉问答基准测试中的得分相当于蒙特利尔视觉基础模型的1.8倍,展现出强大的综合能力。

Qwen3.8-Max模型在PaperBench测试中创93.0分最优绩
最新AI基准测试数据显示,Qwen3.8-Max在全球性PaperBench论文复现能力测试中取得93.0分,成为官方Comparative模型中的最优成绩。该成绩领先其他多个模型近三分。
终端与研发场景的平衡性能展示
技术能力全景呈现
第三方评估显示,Qwen3.8-Max在多个维度上展现差异化表现:PaperBench测试中以93.0分领跑,超过GPQA Diamond的92.6分;而在考察研究工具使用效率的FrontierSWE测试中,其得分为73.5分,相较Claude Fable 5的88.8分有明显差异。测试方强调,不同测试框架对模型的评估存在千差万别。
该款模型展现出在理论研究复现和长周期任务处理上的显著优化能力,与此同时仍保持终端设备的稳定交互体验。不过研究界指出,模型最终表现与测试所使用的智能体框架、工具权限设定以及上下文窗口长度等多个变量密切相关。

Qwen3.8-Max模型发布后在全球排名第二
Qwen3.8-Max模型发布后,在全球模型榜单上表现突出,成为排名最高的中国文本模型,并在视觉模型榜单中位列全球第二,仅落后于Claude Fable 5版本。
海外平台API定价与功能
在海外QwenCloud平台上,Qwen3.8-Max的API价格设定为每百万Token输入2美元、输出6美元,隐式缓存命中价格为每百万Token 0.25美元。开发者可通过指定模型名称调用Qwen3.8-Max,并支持函数调用、结构化输出、上下文缓存及内置搜索工具。
普通用户可直接在Qwen Studio体验该模型,同时Qoder和Qwen Code等编程工具已开始整合此功能。
开放权重政策解读
Qwen团队正式宣布将在发布后一周内开放Qwen3.8-Max的权重,同时推出Qwen3.8-27B的开放版本。这一举措标志着Qwen3.8-Max级旗舰模型首次实现权利化分享,但它不等于完全开源——模型权重虽可下载,但训练数据、完整流程代码仍独立。
截至目前8月4日,Qwen3.8-Max的具体许可证和最终模型卡尚未公布。
解释大模型model weights的概念作为关键词,它指在训练过程中计算得出的权重参数,直接影响模型的预测能力。
大模型竞争转向分析
Qwen3.8-Max的核心价值不在于其2.4万亿参数规模,而是它在竞争中的新态势。这次发布证明全球模型排行榜基准被打破,推动了大模型生态的结构性变化。
API价格结构显示按Token计费机制,强调使用效率;普通用户提供简洁端口,扩大了应用场景,体现了模型从专业到消费级的覆盖宽度。

AI从问答转向任务承担:官方演示展示模型执行能力进展
AI技术正经历从简单回答问题到自主执行复杂任务的转变,这在官方16天演示中得到体现,涉及数百次操作和多个工具协调。企业需注意权限控制等关键因素来确保AI模型可靠应用。
AI模型执行任务的演变
过去,AI主要用于提供精准答案;而现在,焦点转向让AI独立完成目标导向的过程。这包括处理变化结果和持续操作,标志着AI从被动响应向主动工作模式转变。官方演示通过长期测试证明了这种能力的稳定性,但尚未被视为完全成熟的解决方案。
企业应用挑战与限制
尽管官方演示了持续16天的操作案例,但这并不意味着生产系统可立即依赖AI。权限管理、错误恢复机制、审计过程等元素是决定AI模型是否能落地的关键步骤。企业还需依赖第三方复现和真实场景验证,以确保模型可靠性。
未来竞争方向明确
AI价值评估标准正从即时响应速度转向离人工作的持久性能。这意味着模型在无人持续干预下能维持稳定输出的时间,将成为竞争力核心。这一演进推动AI向实用化迈进,缩短了与"数字同事"概念的距离。
AI从任务执行角度出发,强调了自主决策与工具整合的重要性,为后续发展奠定基础。
