一、DeepSeek V4 正式版:7月中旬上线,有哪些升级?
2026年6月29日,DeepSeek团队通过官方邮件宣布:DeepSeek V4 正式版计划于7月中旬全面上线。这是继4月24日V4预览版发布后的正式版本,距离预览版刚好两个半月。
回顾一下,V4预览版刚发布时就引起了不小震动——全系标配100万token超长上下文、定价直接打到"白菜价"、MIT协议完全开源。两个月后,DeepSeek又联合北京大学发布了DSpark推理加速框架,让单用户生成速度再涨60%到85%。
这次正式版的官宣,核心信息有两条:
- 性能继续提升:官方表述是"更多功能优化和性能提升",结合此前DSpark已经全量部署,可以预期正式版在推理速度、稳定性和功能完整性上都会比预览版更进一步。
- 定价机制调整:首次引入峰谷分时定价,高峰时段API价格翻倍。这也是国内大模型厂商首次采用类似电费的分时计费模式。
💡 划重点:这次不是单纯的"涨价"。非高峰时段的价格与当前V4预览版保持一致,高峰时段才翻倍。也就是说,如果你习惯在晚上或周末调用API,成本不受影响。
二、Pro 与 Flash 双版本怎么选?参数与场景对比
DeepSeek V4系列分为两个版本,定位不同,价格也差不少。先看核心参数对比:
| 对比项 | V4-Pro(旗舰版) | V4-Flash(轻量版) |
|---|---|---|
| 总参数量 | 1.6 万亿 | 2840 亿 |
| 激活参数 | 490 亿 | 130 亿 |
| 架构 | MoE 混合专家 | MoE 混合专家 |
| 上下文窗口 | 100 万 tokens | 100 万 tokens |
| 输出上限 | 384K tokens | 384K tokens |
| 预训练数据 | 33T tokens | 32T tokens |
| 定位 | 高性能旗舰,对标国际闭源 | 极致性价比,高频日常场景 |
| 平时段输出价格 | 6 元/百万 tokens | 2 元/百万 tokens |
| 开源协议 | MIT(免费商用) | MIT(免费商用) |
怎么选?给你三个实用建议
1. 日常对话、写作、翻译 → Flash 就够了
Flash版在简单任务上和Pro差距不大,价格只有三分之一。写邮件、改文案、做总结这些场景,Flash完全能打,还更快。
2. 复杂推理、代码、Agent → 上 Pro
高难度任务上Pro的优势就出来了。官方数据显示,V4 Pro的Agent能力、代码生成质量接近Claude Opus的非思考模式。如果你在做智能体开发、复杂数据分析、代码审查,Pro值得这个价。
3. 预算有限但任务复杂 → 分时调用 Pro
既然有峰谷定价了,非实时的复杂任务可以调度到非高峰时段跑Pro,成本和高峰期的Flash差不多,但效果好很多。
三、DSpark 推理加速:速度提升 85% 是怎么做到的?
在正式版上线之前,DeepSeek已经放了一个大招——DSpark 推理加速框架。这个东西有多猛?V4 Flash单用户生成速度提升60%-85%,V4 Pro提升57%-78%。而且是免费的,MIT协议开源。
DSpark 是什么?
简单说,DSpark是一个投机解码(Speculative Decoding)框架。大模型生成文字是一个字一个字往外蹦的,每蹦一个字都要完整跑一遍推理,很慢。投机解码的思路是:找个小模型先"猜"几个字,大模型一次性验证。猜对了就白赚速度,猜错了再按大模型的来。
之前的投机解码方案有个死结:快的不准,准的不快。DSpark破局靠两个设计:
1半自回归架构——并行草稿 + 轻量串行头
第一层并行骨架一口气给每个位置算出基础答案,第二层极轻的串行小头根据前一个token微调结果。既快又准,2层深度的DSpark比5层纯并行方案效果还好。
2负载感知调度器——看GPU脸色办事
GPU闲的时候多验证几个token,忙的时候少验点,避免资源争抢。调度器的预测误差控制在1%左右,基本不会误判。
🎯 对普通用户的实际体验:写一篇3000字的文章,原来可能要等15秒,现在8秒左右就能出完。对话时的"打字感"会流畅很多,几乎感受不到等待。
本地部署用户能用上 DSpark 吗?
实话实说,效果要打折扣。DSpark优化的是服务端高并发场景,论文数据是在大规模集群上测的。个人电脑上单卡跑小模型(比如8B、14B级别),加速比可能只有10%-20%,而且还得自己训练草稿模块,有一定技术门槛。
所以,如果你是API用户,直接享受速度提升就好;如果你是本地部署玩家,DSpark目前更多是参考价值,等社区适配吧。
四、峰谷定价机制详解:价格表与影响分析
峰谷定价是这次最有话题性的变化。说白了,就是高峰时段用得贵,非高峰时段便宜,跟电费一个逻辑。
高峰时段怎么划分?
每天两个高峰段:
- 上午 9:00 - 12:00
- 下午 14:00 - 18:00
合计7小时,占全天约29%。其余时间(包括晚间、夜间、周末全天)都是平时段价格。
完整价格表
| 模型 | 计费项 | 平时段 | 高峰时段(×2) |
|---|---|---|---|
| V4-Pro | 输入(缓存命中) | 0.025 元/百万 | 0.05 元/百万 |
| 输入(缓存未命中) | 3 元/百万 | 6 元/百万 | |
| 输出 | 6 元/百万 | 12 元/百万 | |
| V4-Flash | 输入(缓存命中) | 0.02 元/百万 | 0.04 元/百万 |
| 输入(缓存未命中) | 1 元/百万 | 2 元/百万 | |
| 输出 | 2 元/百万 | 4 元/百万 |
⚠️ 注意:缓存命中和未命中的价格差了100多倍!这个差距比峰谷定价的2倍差距大得多。优化缓存命中可能比避峰调用更省钱。
谁受影响最大?
受影响最大的:实时客服机器人、代码Copilot、Agent工作流等高频交互场景,如果所有调用都在工作时段,成本直接翻倍。
几乎不受影响的:批处理任务、离线数据总结、非实时内容生成——把任务调度到晚上或周末跑就行了。
五、开发者应对策略:怎么用最便宜?
既然规则变了,玩法也要跟上。给你几个省钱的实操建议:
策略一:任务分时段调度
把非紧急的批量任务安排在晚上22:00到次日8:00之间执行,或者干脆放周末。成本直接降一半。
适合:文档批量总结、数据清洗、内容批量生成、代码库分析。
策略二:优化缓存命中率
缓存命中的输入价格是未命中的1/120(Pro版),这个杠杆比避峰调用大得多。怎么提升命中率?
- 把固定的System Prompt抽出来,放在对话最前面
- 长上下文任务尽量复用同一个会话窗口,不要每次开新对话
- 模板化任务输入,比如把格式要求、角色设定写死在prompt开头
策略三:Flash 与 Pro 按需切换
高峰期用Flash处理简单任务,非高峰期用Pro处理复杂任务。同样的预算,效果比全程用Pro好得多。
策略四:本地部署 + API 混合
简单任务本地跑(用Ollama + 7B/8B模型),复杂任务调API。日常对话、简单写作本地完全够用,真正需要强推理的时候才走云端。长期来看,这可能是成本最低的方案。
六、本地部署指南:Ollama 一键跑 V4
很多人关心的问题:DeepSeek V4 能本地跑吗?怎么跑?
答案是:能跑,但要看你的显卡。V4 Flash是2840亿总参数、130亿激活参数的MoE模型,量化后也要十几GB显存起步。普通消费级显卡跑起来比较吃力,但也不是完全不能玩。
显存需求参考
| 量化方式 | 显存需求(估算) | 推荐显卡 |
|---|---|---|
| Q2_K 量化 | 约 10-12 GB | RTX 3080 12G / 4070 Ti 以上 |
| Q3_K_M 量化 | 约 14-16 GB | RTX 4080 / 3090 / 4090 |
| Q4_K_M 量化 | 约 18-20 GB | RTX 4090 / A10G |
| Q5_K_M / FP16 | 24 GB+ | A100 / 多卡方案 |
💡 8G 显存用户怎么办?老老实实跑 qwen3:8b 或 deepseek-r1:8b 吧,性价比更高。V4虽然强,但强行跑体验很差,推理速度可能慢到每秒几个token。
Ollama 部署步骤
1安装 Ollama
去官网 ollama.com 下载对应系统的安装包,Windows/Mac/Linux 都支持。国内用户建议设置镜像加速:
# 设置环境变量(Windows 系统)
set OLLAMA_HF_ENDPOINT=https://hf-mirror.com
# Linux/Mac
export OLLAMA_HF_ENDPOINT=https://hf-mirror.com
2拉取模型
打开终端执行:
# V4 Flash(推荐先试这个)
ollama run deepseek-v4:284b-flash
# 或者更小的参数版本
ollama run deepseek-v4:14b
注意:V4 Flash完整版本体很大,确保硬盘有足够空间。如果显存不够,Ollama会自动用CPU+内存补,但速度会慢很多。
3测试使用
拉取完成后直接在终端里对话就可以了。也可以通过API调用:
curl http://localhost:11434/api/chat -d '{
"model": "deepseek-v4:284b-flash",
"messages": [
{"role": "user", "content": "你好,介绍一下你自己"}
]
}'
七、行业影响:算力开始像电费一样计费?
DeepSeek的峰谷定价,表面看是个调价动作,往深了想,其实是个行业信号。
AI 算力正在变成基础设施
峰谷电价这个东西,电网已经用了几十年。为什么需要?因为发电量不能随便调,锅炉不能说停就停。AI算力也一样,GPU集群24小时转着,白天大家都用就挤,晚上空着也是空着。
DeepSeek第一个把"算力分时定价"摆上台面,说明行业已经从"烧钱抢用户"阶段,进入了"精细化运营"阶段。这是成熟的标志。
其他厂会跟进吗?
大概率会。算力成本的结构是一样的,谁先学会用价格杠杆调度需求,谁的毛利率就好看。半年之内,峰谷定价可能会变成行业标配——就像当年按量付费取代包月一样自然。
对中小开发者意味着什么?
短期看,成本可能上升(如果你所有调用都在工作时段)。长期看,其实是好事:
- 逼你优化调用方式,学会缓存和任务调度
- 工具链会快速适配,比如CI/CD自动调度到低峰时段
- 整体算力利用率提高了,长期价格会往下走
说白了,以前算力是"自助餐",随便吃但可能抢不到;以后是"按时段点菜",你可以选便宜的时候吃,也能保证高峰时段吃得着。
八、总结与展望
最后梳理一下DeepSeek V4正式版的关键点:
✅ 好消息:
- DSpark让推理速度提升最高85%,免费享受
- 非高峰时段价格不变,甚至缓存命中低到0.02元/百万token
- 下半年昇腾950量产后Pro版还有降价空间
- MIT协议完全开源,可免费商用
⚠️ 需要注意:
- 高峰时段(工作日9-12点、14-18点)API价格翻倍
- V4本地部署门槛较高,消费级显卡体验一般
- 正式版具体功能升级内容尚未完全披露
整体来看,DeepSeek V4正式版的升级是"加量不加价"的逻辑——速度更快了,功能更全了,平时段价格维持不变,高峰时段用价格杠杆保障稳定性。对于能灵活调度任务的开发者来说,甚至可以算是利好。
如果你正在做AI相关的产品或项目,建议提前规划:梳理一下哪些任务是实时的、哪些是可延迟的,优化一下prompt结构提升缓存命中率,有条件的话试试本地部署小模型处理简单任务。这几件事做完,峰谷定价对你的影响就很小了。
7月中旬正式版上线后,我们会第一时间做实测对比,关注AIBoxs不迷路。