首页 / 科技 / DeepSeek V4 Flash跻身AA模型综合智能指数前20名,任务成本仅84美分

DeepSeek V4 Flash跻身AA模型综合智能指数前20名,任务成本仅84美分

摸鱼不慌
摸鱼不慌
  【CNMO科技消息】中国人工智能模型正在以惊人的速度缩小与OpenAI、Anthropic等前沿模型的性能差距,同时在“性能比”(即任务成本)这一关键指标上展现出压倒性优势。近日,据独立AI模型评估平台Artificial Analysis(AA)发布的数据,在全球前20大AI模型中,DeepSeek V4 Flash以单任务仅3美分的成本成为最经济的选择。DeepSeek V4 Flash跻身AA模型综合智能指数前20名,任务成本仅84美分  第1张

中国AI模型在最新性能评估中取得显著进展。据AA模型综合智能指数显示,DeepSeek V4 Flash以60分以上成绩位列前20名。其任务成本控制在84美分,处于前沿模型较低水平。

中国模型批量进入国际顶尖排名

月之暗面Kimi K3与阿里巴巴Qwen 3.8 Max等产品近期完成更新。数据显示,两者均在AA模型综合智能指数前10名中占据席位。其中Kimi K3以60分成绩成为该榜单唯一开放权重模型。

排名对比显示,Kimi K3与Claude Opus 5相差3分,与GPT-5.6 Sol仅差1分。这一差距表明中国企业研发的AI模型在综合性能上已接近国际先进水平。

性能指标与成本控制平衡发展

AA模型综合智能指数包含多维度评估体系,涵盖推理能力、自然语言处理等关键指标。Kimi K3在60分以上模型中维持开放权重特性,意味着其代码可被用户直接调用。

任务成本84美分的计算基于特定硬件配置与运行环境。该数值反映模型在保持高性能的同时,实现了算力消耗的优化管理。

“当前模型的参数量与算力消耗比率达到新水平。”
  • DeepSeek V4 Flash进入前20名
  • Kimi K3为唯一开放权重模型
  • 任务成本84美分处于行业低位
  • Claude Opus 5保持首位优势

市场观察指出,中国模型在参数规模与成本控制间的平衡策略,正在改变全球AI竞争格局。但具体应用效果仍需长期验证。

DeepSeek V4 Flash跻身AA模型综合智能指数前20名,任务成本仅84美分  第2张任务成本:企业AI支出的真实标尺  在AI模型成本评估中,令牌单价并非全貌。推理模型在回答前会消耗大量内部“思考”令牌,因此即便令牌单价低廉,单任务的总体成本仍可能偏高。“任务成本”更能反映企业实际支出——即完成特定工作所需的总令牌消耗量。  DeepSeek V4 Flash的智能指数为52分,与OpenAI GPT-5.6 Luna(max模式)持平,而任务成本仅3美分,略低于后者的5美分。更为关键的是,DeepSeek V4 Flash的首字响应时间(TTFT)为1.17秒,端到端响应时间为19.49秒;而GPT-5.6 Luna(max)的TTFT长达135秒以上。两者智能指数和任务成本相近,但DeepSeek的响应速度优势极为显著。响应速度与商业模式的双重优势  在响应速度的对比中,Claude Opus 5表现突出:TTFT为5.92秒,端到端响应时间仅14.68秒,整体耗时仅为同级模型的四分之一。  此外,DeepSeek V4 Flash为开放权重模型(MIT许可证),允许企业自行托管;而GPT-5.6 Luna仅为API专用。这一差异在实际部署中可能对开发者的选择产生重要影响。  阿里巴巴新发布的Qwen 3.8 Max拥有2.4万亿参数,智能指数达58分,位列第10,印证了阿里巴巴“历代最强Qwen”的说法。但其任务成本为1.13美元,高于同级别竞品。  在1美分任务成本区间,GPT-5.6 Luna(low模式)、MiMo-V2.5和Llama 4 Scout均位列其中。其中MiMo-V2.5(智能指数37分)在同价位模型中性价比最高。DeepSeek V4 Flash跻身AA模型综合智能指数前20名,任务成本仅84美分  第3张

Uber年度AI预算4月耗尽 亚马逊项目成本飙涨860%

据《福布斯》5月报道,Uber年度预算在2026年4月提前耗尽,成为企业AI支出失控的典型案例。约5000名工程师组成的组织中,Claude Code的快速普及使AI支出远超预期。

强制设定使用上限

Uber随后为每位员工设定了每月1500美元的代理式编程工具使用上限。该措施旨在控制成本增长,但未能完全遏制支出激增态势。

亚马逊项目成本激增

亚马逊也面临类似困境。其内部AI项目利用Anthropic Claude Sonnet进行商品列表与作者信息比对,项目成本超出原始预算860%,达到约180万美元。更大的问题在于,令牌使用带来的成本增长在长达5个月内未被及时发现。

“提示缓存”技术虽能减少部分费用,但缓存失效仍需全额计费。企业需权衡上下文长度与成本控制间的平衡关系。

成本结构演变

AI令牌成本正急剧攀升,主要源于模型在企业内部向代理式功能和推理型任务转型。这种转变使单个任务消耗量大幅增加,导致预算快速透支。

行业影响扩散

随着AI模型在企业内部快速扩散,成本失控现象开始显现。技术团队需重新评估算力分配策略,以应对日益增长的开支压力。

  • 2026年4月Uber年度AI预算耗尽
  • 5000名工程师使用Claude Code
  • 亚马逊项目成本超出原始预算860%
  • 提示缓存失效导致费用按原价重新计算

这一现象引发企业IT部门对AI算力分配的重新审视,预示着AI应用成本控制成为新挑战。

DeepSeek V4 Flash跻身AA模型综合智能指数前20名,任务成本仅84美分  第4张

AA智能指数综合九项评估,任务成本基于令牌消耗计算

AA技术平台最新发布智能指数测算体系,采用多维度评估框架量化模型表现。

【评估体系构成】

该体系包含GDPval-AA v2、τ-Bench Banking等九项专项指标,通过加权算法生成综合评分。

每个组件分别对应不同领域任务,如编码、数学、科学计算及代理式操作。

τ-Bench Banking评估银行场景处理能力,SciCode测试科学文献理解水平

【成本核算机制】

任务成本计算公式为令牌消耗量乘以单价,涵盖输入、缓存、推理等全链路环节。

当前统计数据显示,综合成本评估包含欠费侦测、推理链重量等参数。

【应用限制说明】

开发者需注意该指标针对性较强,主要适用于涉及多领域技术任务的评估场景。

  • GreenDune指标侧重经济模型分析
  • K-Means评估数据聚类效能
  • Ember测试长文本生成能力
  • Basalt关注界面交互体验
  • Baleen衡量数据处理效率

相关技术参数将通过API接口开放,供企业研发部门参考。