7月中旬
正式版上线时间
85%
单用户生成速度提升
1M tokens
超长上下文窗口

一、DeepSeek V4 正式版:7月中旬上线,有哪些升级?

2026年6月29日,DeepSeek团队通过官方邮件宣布:DeepSeek V4 正式版计划于7月中旬全面上线。这是继4月24日V4预览版发布后的正式版本,距离预览版刚好两个半月。

回顾一下,V4预览版刚发布时就引起了不小震动——全系标配100万token超长上下文、定价直接打到"白菜价"、MIT协议完全开源。两个月后,DeepSeek又联合北京大学发布了DSpark推理加速框架,让单用户生成速度再涨60%到85%。

这次正式版的官宣,核心信息有两条:

💡 划重点:这次不是单纯的"涨价"。非高峰时段的价格与当前V4预览版保持一致,高峰时段才翻倍。也就是说,如果你习惯在晚上或周末调用API,成本不受影响。

二、Pro 与 Flash 双版本怎么选?参数与场景对比

DeepSeek V4系列分为两个版本,定位不同,价格也差不少。先看核心参数对比:

对比项 V4-Pro(旗舰版) V4-Flash(轻量版)
总参数量 1.6 万亿 2840 亿
激活参数 490 亿 130 亿
架构 MoE 混合专家 MoE 混合专家
上下文窗口 100 万 tokens 100 万 tokens
输出上限 384K tokens 384K tokens
预训练数据 33T tokens 32T tokens
定位 高性能旗舰,对标国际闭源 极致性价比,高频日常场景
平时段输出价格 6 元/百万 tokens 2 元/百万 tokens
开源协议 MIT(免费商用) MIT(免费商用)

怎么选?给你三个实用建议

1. 日常对话、写作、翻译 → Flash 就够了

Flash版在简单任务上和Pro差距不大,价格只有三分之一。写邮件、改文案、做总结这些场景,Flash完全能打,还更快。

2. 复杂推理、代码、Agent → 上 Pro

高难度任务上Pro的优势就出来了。官方数据显示,V4 Pro的Agent能力、代码生成质量接近Claude Opus的非思考模式。如果你在做智能体开发、复杂数据分析、代码审查,Pro值得这个价。

3. 预算有限但任务复杂 → 分时调用 Pro

既然有峰谷定价了,非实时的复杂任务可以调度到非高峰时段跑Pro,成本和高峰期的Flash差不多,但效果好很多。

三、DSpark 推理加速:速度提升 85% 是怎么做到的?

在正式版上线之前,DeepSeek已经放了一个大招——DSpark 推理加速框架。这个东西有多猛?V4 Flash单用户生成速度提升60%-85%,V4 Pro提升57%-78%。而且是免费的,MIT协议开源。

DSpark 是什么?

简单说,DSpark是一个投机解码(Speculative Decoding)框架。大模型生成文字是一个字一个字往外蹦的,每蹦一个字都要完整跑一遍推理,很慢。投机解码的思路是:找个小模型先"猜"几个字,大模型一次性验证。猜对了就白赚速度,猜错了再按大模型的来。

之前的投机解码方案有个死结:快的不准,准的不快。DSpark破局靠两个设计:

1半自回归架构——并行草稿 + 轻量串行头

第一层并行骨架一口气给每个位置算出基础答案,第二层极轻的串行小头根据前一个token微调结果。既快又准,2层深度的DSpark比5层纯并行方案效果还好。

2负载感知调度器——看GPU脸色办事

GPU闲的时候多验证几个token,忙的时候少验点,避免资源争抢。调度器的预测误差控制在1%左右,基本不会误判。

🎯 对普通用户的实际体验:写一篇3000字的文章,原来可能要等15秒,现在8秒左右就能出完。对话时的"打字感"会流畅很多,几乎感受不到等待。

本地部署用户能用上 DSpark 吗?

实话实说,效果要打折扣。DSpark优化的是服务端高并发场景,论文数据是在大规模集群上测的。个人电脑上单卡跑小模型(比如8B、14B级别),加速比可能只有10%-20%,而且还得自己训练草稿模块,有一定技术门槛。

所以,如果你是API用户,直接享受速度提升就好;如果你是本地部署玩家,DSpark目前更多是参考价值,等社区适配吧。

四、峰谷定价机制详解:价格表与影响分析

峰谷定价是这次最有话题性的变化。说白了,就是高峰时段用得贵,非高峰时段便宜,跟电费一个逻辑。

高峰时段怎么划分?

每天两个高峰段:

合计7小时,占全天约29%。其余时间(包括晚间、夜间、周末全天)都是平时段价格。

完整价格表

模型 计费项 平时段 高峰时段(×2)
V4-Pro 输入(缓存命中) 0.025 元/百万 0.05 元/百万
输入(缓存未命中) 3 元/百万 6 元/百万
输出 6 元/百万 12 元/百万
V4-Flash 输入(缓存命中) 0.02 元/百万 0.04 元/百万
输入(缓存未命中) 1 元/百万 2 元/百万
输出 2 元/百万 4 元/百万

⚠️ 注意:缓存命中和未命中的价格差了100多倍!这个差距比峰谷定价的2倍差距大得多。优化缓存命中可能比避峰调用更省钱。

谁受影响最大?

受影响最大的:实时客服机器人、代码Copilot、Agent工作流等高频交互场景,如果所有调用都在工作时段,成本直接翻倍。

几乎不受影响的:批处理任务、离线数据总结、非实时内容生成——把任务调度到晚上或周末跑就行了。

五、开发者应对策略:怎么用最便宜?

既然规则变了,玩法也要跟上。给你几个省钱的实操建议:

策略一:任务分时段调度

把非紧急的批量任务安排在晚上22:00到次日8:00之间执行,或者干脆放周末。成本直接降一半。

适合:文档批量总结、数据清洗、内容批量生成、代码库分析。

策略二:优化缓存命中率

缓存命中的输入价格是未命中的1/120(Pro版),这个杠杆比避峰调用大得多。怎么提升命中率?

策略三:Flash 与 Pro 按需切换

高峰期用Flash处理简单任务,非高峰期用Pro处理复杂任务。同样的预算,效果比全程用Pro好得多。

策略四:本地部署 + API 混合

简单任务本地跑(用Ollama + 7B/8B模型),复杂任务调API。日常对话、简单写作本地完全够用,真正需要强推理的时候才走云端。长期来看,这可能是成本最低的方案。

六、本地部署指南:Ollama 一键跑 V4

很多人关心的问题:DeepSeek V4 能本地跑吗?怎么跑?

答案是:能跑,但要看你的显卡。V4 Flash是2840亿总参数、130亿激活参数的MoE模型,量化后也要十几GB显存起步。普通消费级显卡跑起来比较吃力,但也不是完全不能玩。

显存需求参考

量化方式 显存需求(估算) 推荐显卡
Q2_K 量化 约 10-12 GB RTX 3080 12G / 4070 Ti 以上
Q3_K_M 量化 约 14-16 GB RTX 4080 / 3090 / 4090
Q4_K_M 量化 约 18-20 GB RTX 4090 / A10G
Q5_K_M / FP16 24 GB+ A100 / 多卡方案

💡 8G 显存用户怎么办?老老实实跑 qwen3:8b 或 deepseek-r1:8b 吧,性价比更高。V4虽然强,但强行跑体验很差,推理速度可能慢到每秒几个token。

Ollama 部署步骤

1安装 Ollama

去官网 ollama.com 下载对应系统的安装包,Windows/Mac/Linux 都支持。国内用户建议设置镜像加速:

# 设置环境变量(Windows 系统)
set OLLAMA_HF_ENDPOINT=https://hf-mirror.com

# Linux/Mac
export OLLAMA_HF_ENDPOINT=https://hf-mirror.com

2拉取模型

打开终端执行:

# V4 Flash(推荐先试这个)
ollama run deepseek-v4:284b-flash

# 或者更小的参数版本
ollama run deepseek-v4:14b

注意:V4 Flash完整版本体很大,确保硬盘有足够空间。如果显存不够,Ollama会自动用CPU+内存补,但速度会慢很多。

3测试使用

拉取完成后直接在终端里对话就可以了。也可以通过API调用:

curl http://localhost:11434/api/chat -d '{
  "model": "deepseek-v4:284b-flash",
  "messages": [
    {"role": "user", "content": "你好,介绍一下你自己"}
  ]
}'

七、行业影响:算力开始像电费一样计费?

DeepSeek的峰谷定价,表面看是个调价动作,往深了想,其实是个行业信号。

AI 算力正在变成基础设施

峰谷电价这个东西,电网已经用了几十年。为什么需要?因为发电量不能随便调,锅炉不能说停就停。AI算力也一样,GPU集群24小时转着,白天大家都用就挤,晚上空着也是空着。

DeepSeek第一个把"算力分时定价"摆上台面,说明行业已经从"烧钱抢用户"阶段,进入了"精细化运营"阶段。这是成熟的标志。

其他厂会跟进吗?

大概率会。算力成本的结构是一样的,谁先学会用价格杠杆调度需求,谁的毛利率就好看。半年之内,峰谷定价可能会变成行业标配——就像当年按量付费取代包月一样自然。

对中小开发者意味着什么?

短期看,成本可能上升(如果你所有调用都在工作时段)。长期看,其实是好事:

说白了,以前算力是"自助餐",随便吃但可能抢不到;以后是"按时段点菜",你可以选便宜的时候吃,也能保证高峰时段吃得着。

八、总结与展望

最后梳理一下DeepSeek V4正式版的关键点:

✅ 好消息:

  • DSpark让推理速度提升最高85%,免费享受
  • 非高峰时段价格不变,甚至缓存命中低到0.02元/百万token
  • 下半年昇腾950量产后Pro版还有降价空间
  • MIT协议完全开源,可免费商用

⚠️ 需要注意:

  • 高峰时段(工作日9-12点、14-18点)API价格翻倍
  • V4本地部署门槛较高,消费级显卡体验一般
  • 正式版具体功能升级内容尚未完全披露

整体来看,DeepSeek V4正式版的升级是"加量不加价"的逻辑——速度更快了,功能更全了,平时段价格维持不变,高峰时段用价格杠杆保障稳定性。对于能灵活调度任务的开发者来说,甚至可以算是利好。

如果你正在做AI相关的产品或项目,建议提前规划:梳理一下哪些任务是实时的、哪些是可延迟的,优化一下prompt结构提升缓存命中率,有条件的话试试本地部署小模型处理简单任务。这几件事做完,峰谷定价对你的影响就很小了。

7月中旬正式版上线后,我们会第一时间做实测对比,关注AIBoxs不迷路。