| |
|
| 知识库 -> 科技 -> DeepSeek V4 正式版将于 7 月中旬上线,你有什么期待? -> 正文阅读 |
|
|
[科技]DeepSeek V4 正式版将于 7 月中旬上线,你有什么期待? |
| [收藏本文] 【下载本文】 |
|
正式版上线后将同步调整 API 价格: [图片] |
|
从目前灰度测试来看,正式版很强,非常强 实测有opus4.8以上水平 一句话生成minecraft 【DeepSeek V4正式版生成的《我的世界》-哔哩哔哩】 https://b23.tv/jBVay22 |
|
|
|
|
【国产之光再进化!DeepSeek V4正式版简测,附带横评Gemini3.5 Pro / Grok4.5等-哔哩哔哩】 https://b23.tv/lLIqhio 根据这个视频,html coding能力,gemini 3.5 pro >grok 4.5>deepseek v4 pro 正式版>glm 5.2. 根据一些消息,Grok 4.5介于fable 5和opus 4.8之间,根据知乎评价,glm 5.2介于opus 4.8和4.6之间。 正式版coding能力估计是接近opus 4.8的水平,符合预期。参考glm 5的进化,deepseek v4 pro的底座模型应该还有一两个版本的潜力。 Deepseek和glm最大的好处是全开源,大公司和机构可以自己架设,避免数据安全问题,还可能降低成本,虽说deepseek已经够便宜了。 |
|
官方放出的预告信息极其有限——性能提升幅度不透明,只说了:性能会提升,会追加功能。 可解读空间非常大。 这次 V4 正式版更新,大概会是以下三个版本: 爽文版:V4 对标 GLM-5.2,另开 V4.1 高端副本 这是最让玩家热血的版本。GLM-5.2 当前是国内代码赛道的硬通货,开发刚需极强,但算力产能有限,Coding 订阅套餐每天定点抢购,几分钟售罄,玩家调侃“比抢演唱会门票难”。 如果 DeepSeek V4 正式版的基座性能真的追平了 GLM-5.2,它完全可以另开一个副本叫 V4.1,脱离低价内卷赛道,直接对标 GLM 的 Token Plan 订阅模式——按量 API 走高价散单,月度套餐打包固定额度 + 专属算力隔离 + 高峰免排队。 但由于它涨价是涨价了,但涨得不多,我觉得超过 GLM-5.2 的可能性不大。 概率:中。 现实版:检查点微调 + 峰谷调价,清理低效调用 官方提前近两周邮件通知峰谷调价,核心目标极其直白:缓解算力负载爆仓。 Preview 版上线两个月,API 日调用量指数级暴涨,工作日白天并发长期触碰算力上限。后台数据暴露了一个经典问题:短 Prompt 重复刷新、无缓存的测试调用、蹭低价的自动化任务,挤占了高价值长任务的算力。 突然,感觉有点被套路了,可能这个检查点,就是为了来应对调价的,性能提升不大,但多少也算个理由。 如果 API 命名 deepseek-v4-pro 还是不变,这种概率就很高。如果是服务器吃紧,那这种行为也不是不能理解。 概率:高。 油腻版:没什么性能提升,单纯盲目涨价 负载没爆,但性能也没有明显提升,(没跨过一条可感知的阈值线),涨价纯粹过于自信。如果是这样,那太没意思了,合着等了两个多月,就给我看这个?这种情况可能性比较小。如果这种事情发生,我就跟 DeepSeek 割席断交。 概率:低。 个人最关心的问题 DeepSeek 第一方独占大作 —— Code CLI 会不会出。光有模型,现在也不行,加上Agent 软件配套,可玩性才能提上来。 送礼物 还没有人送礼物,鼓励一下作者吧 |
|
如果你期待它拳打Opus脚踢GPT,那大概率要失望,能对标GLM5.2就非常不错了。 B站有一批UP主拿到了V4正式版灰度,现在有一些灰度测试的视频,比如说“一句话生成游戏”系列。 比如说一句话生成《我的世界》,模型吐出来一个完整的HTML文件,你别说还真能玩。3D体素沙盒,地形生成、移动跳跃、方块放置破坏,核心机制全有。 |
|
|
还有个生成CSGO的视频,这画面是有点简陋,不过核心逻辑是没毛病的,地图结构、射击逻辑、对抗机制全都有。 |
|
|
还有以撒结合,这个完成度相当好,小地图、积分、弹幕,逻辑一次就正确生成了。 |
|
|
还有GTA5风格开放世界、后室恐怖游戏等等,感兴趣大家可以自己去搜。 V4预览版我用一个月了,肯定做不到这些。从一句话直接到可运行成品,中间几乎不需要人工干预,正式版直接达到这个水平,这个跨越幅度还是相当大的。 DS V4正式版在编程能力上的提升,跟前段时间引爆代码圈的GLM 5.2高度相似。 大家对GLM 5.2的期待,原本只是一个小版本的提升,谁知道竟然直接逼近Opus 4.8的水平,达到开源模型的SOTA。 智谱砍掉了多模态,把全部参数预算押在代码和数学推理上,结果一个700B的模型达到5T模型的水平。 而DS V4的参数量是1.6T,理论上限比GLM要高。V4正式版从目前灰度测试的样子来看,跟GLM 5.2在同一个区间,谁高谁低得等正式版上线后才看得出来。 关键是DS的价格,经过前段时间高峰期价格翻倍,跟GLM、Kimi的套餐比已经没有太多优势。但如果正式版能对标GLM 5.2,DS又将成为性价比之王。 |
|
|
而且opencode go里面的ds-v4-pro实际费用约等于官方API的六折,我已经准备把opencode+ds作为我的主力开发了。7月中旬正式版上线后,灰度测试里展现出来的这些东西能不能稳定落地,才是真正的考验。 |
|
前几天看到了很多 似乎是 DeepSeek 正式版的API 做的东西。就在 B 站,一搜“DeepSeek V4正式版”就有。 效果上讲,对比 DeepSeek V4 预览版本,只能用惊艳来形容,不亚于 R1-0120 到 0528 的区别。这个表现绝对比 glm5.2 强,跟 GPT 和 Claude 也肯定毫不逊色(Fable 还是比不过的)。 b 站上对 deepseek的测试: |
|
|
|
|
|
|
|
|
结果非常棒 测试是针对 wish coding 场景的,之前 deepseek 差的就是这一方面(尤其是 flash,现在版本有完整计划的话执行起来又快又准) 当然,如果对比网页版上的 deepseek,我倒也觉得在正常范围内。 这是我之前测的快速模式: 今天补测的专家模型(可以确认又换回 pro 了,之前似乎用过一段时间的 flash,速度非常快,现在又慢下来了) 网页版效果也出奇的惊人。考虑到套上 harness 的进步,这结果也就不意外。 补充:现在有人说目前 b 站上的版本不是正式版,而是更高阶的版本? 我倾向于不是更高阶的版本而是正式版。不然对于 AI 这种第一梯队与第二梯队热度断档的领域,DeepSeek 是很吃亏的。除非那个版本没做过安全对齐直接错误放上来了,倒有小概率可能。 也不知道那个人怎么稳定灰度到正式版的。 总之,我还是很期待的,deepseek 涨价是有自信的! |
|
|
| [收藏本文] 【下载本文】 |
| 上一篇文章 查看所有文章 |
|
|
|
|
娱乐生活:
电影票房
娱乐圈
娱乐
弱智
火研
中华城市
印度
仙家
六爻
佛门
风水
古钱币交流专用
钓鱼
双色球
航空母舰
网球
乒乓球
中国女排
足球
nba
中超
跑步
象棋
体操
戒色
上海男科
80后
足球: 曼城 利物浦队 托特纳姆热刺 皇家马德里 尤文图斯 罗马 拉齐奥 米兰 里昂 巴黎圣日尔曼 曼联 |
| 网站联系: qq:121756557 email:121756557@qq.com 知识库 |