DeepSeek V4 Flash跻身AA模型综合智能指数前20名,任务成本仅84美分
中国AI模型在最新性能评估中取得显著进展。据AA模型综合智能指数显示,DeepSeek V4 Flash以60分以上成绩位列前20名。其任务成本控制在84美分,处于前沿模型较低水平。
中国模型批量进入国际顶尖排名
月之暗面Kimi K3与阿里巴巴Qwen 3.8 Max等产品近期完成更新。数据显示,两者均在AA模型综合智能指数前10名中占据席位。其中Kimi K3以60分成绩成为该榜单唯一开放权重模型。
排名对比显示,Kimi K3与Claude Opus 5相差3分,与GPT-5.6 Sol仅差1分。这一差距表明中国企业研发的AI模型在综合性能上已接近国际先进水平。
性能指标与成本控制平衡发展
AA模型综合智能指数包含多维度评估体系,涵盖推理能力、自然语言处理等关键指标。Kimi K3在60分以上模型中维持开放权重特性,意味着其代码可被用户直接调用。
任务成本84美分的计算基于特定硬件配置与运行环境。该数值反映模型在保持高性能的同时,实现了算力消耗的优化管理。
“当前模型的参数量与算力消耗比率达到新水平。”
- DeepSeek V4 Flash进入前20名
- Kimi K3为唯一开放权重模型
- 任务成本84美分处于行业低位
- Claude Opus 5保持首位优势
市场观察指出,中国模型在参数规模与成本控制间的平衡策略,正在改变全球AI竞争格局。但具体应用效果仍需长期验证。
任务成本:企业AI支出的真实标尺 在AI模型成本评估中,令牌单价并非全貌。推理模型在回答前会消耗大量内部“思考”令牌,因此即便令牌单价低廉,单任务的总体成本仍可能偏高。“任务成本”更能反映企业实际支出——即完成特定工作所需的总令牌消耗量。 DeepSeek V4 Flash的智能指数为52分,与OpenAI GPT-5.6 Luna(max模式)持平,而任务成本仅3美分,略低于后者的5美分。更为关键的是,DeepSeek V4 Flash的首字响应时间(TTFT)为1.17秒,端到端响应时间为19.49秒;而GPT-5.6 Luna(max)的TTFT长达135秒以上。两者智能指数和任务成本相近,但DeepSeek的响应速度优势极为显著。响应速度与商业模式的双重优势 在响应速度的对比中,Claude Opus 5表现突出:TTFT为5.92秒,端到端响应时间仅14.68秒,整体耗时仅为同级模型的四分之一。 此外,DeepSeek V4 Flash为开放权重模型(MIT许可证),允许企业自行托管;而GPT-5.6 Luna仅为API专用。这一差异在实际部署中可能对开发者的选择产生重要影响。 阿里巴巴新发布的Qwen 3.8 Max拥有2.4万亿参数,智能指数达58分,位列第10,印证了阿里巴巴“历代最强Qwen”的说法。但其任务成本为1.13美元,高于同级别竞品。 在1美分任务成本区间,GPT-5.6 Luna(low模式)、MiMo-V2.5和Llama 4 Scout均位列其中。其中MiMo-V2.5(智能指数37分)在同价位模型中性价比最高。
Uber年度AI预算4月耗尽 亚马逊项目成本飙涨860%
据《福布斯》5月报道,Uber年度预算在2026年4月提前耗尽,成为企业AI支出失控的典型案例。约5000名工程师组成的组织中,Claude Code的快速普及使AI支出远超预期。
强制设定使用上限
Uber随后为每位员工设定了每月1500美元的代理式编程工具使用上限。该措施旨在控制成本增长,但未能完全遏制支出激增态势。
亚马逊项目成本激增
亚马逊也面临类似困境。其内部AI项目利用Anthropic Claude Sonnet进行商品列表与作者信息比对,项目成本超出原始预算860%,达到约180万美元。更大的问题在于,令牌使用带来的成本增长在长达5个月内未被及时发现。
“提示缓存”技术虽能减少部分费用,但缓存失效仍需全额计费。企业需权衡上下文长度与成本控制间的平衡关系。
成本结构演变
AI令牌成本正急剧攀升,主要源于模型在企业内部向代理式功能和推理型任务转型。这种转变使单个任务消耗量大幅增加,导致预算快速透支。
行业影响扩散
随着AI模型在企业内部快速扩散,成本失控现象开始显现。技术团队需重新评估算力分配策略,以应对日益增长的开支压力。
- 2026年4月Uber年度AI预算耗尽
- 5000名工程师使用Claude Code
- 亚马逊项目成本超出原始预算860%
- 提示缓存失效导致费用按原价重新计算
这一现象引发企业IT部门对AI算力分配的重新审视,预示着AI应用成本控制成为新挑战。

AA智能指数综合九项评估,任务成本基于令牌消耗计算
AA技术平台最新发布智能指数测算体系,采用多维度评估框架量化模型表现。
【评估体系构成】
该体系包含GDPval-AA v2、τ-Bench Banking等九项专项指标,通过加权算法生成综合评分。
每个组件分别对应不同领域任务,如编码、数学、科学计算及代理式操作。
τ-Bench Banking评估银行场景处理能力,SciCode测试科学文献理解水平
【成本核算机制】
任务成本计算公式为令牌消耗量乘以单价,涵盖输入、缓存、推理等全链路环节。
当前统计数据显示,综合成本评估包含欠费侦测、推理链重量等参数。
【应用限制说明】
开发者需注意该指标针对性较强,主要适用于涉及多领域技术任务的评估场景。
- GreenDune指标侧重经济模型分析
- K-Means评估数据聚类效能
- Ember测试长文本生成能力
- Basalt关注界面交互体验
- Baleen衡量数据处理效率
相关技术参数将通过API接口开放,供企业研发部门参考。
