范凯说 AI · 周日晚聊 第32期:国产开源大爆发,到底哪个才是最强?

AI直播国产大模型DeepSeek英伟达

开场

大家好,欢迎来到《范凯说 AI · 周日晚聊》,今天是第 32 期。

这周 AI 圈子很热闹:智谱、阿里、腾讯三天连发三款国产 Flash 模型,价格一个比一个低,目标都是围剿 DeepSeek。评测榜上 DeepSeek 被打得毫无还手之力,但我在真实的 Agent 测试场景里发现,结论完全反过来——DeepSeek V4 Flash 又快又好,GLM 慢得离谱,Kimi 干脆没完成评测。

另外还有几件有意思的事:英伟达发布了史上最强的财报,同时传出要花 129 亿美元收购 Hugging Face;特斯拉把 Grok 接进了电动车;OpenAI 因为 Cursor 被收购而宣布断供。

开场先问大家一个问题:你现在主力在用的国产开源模型是哪个?用 DeepSeek 的打 1,用智谱 GLM 的打 2,用阿里千问的打 3,用腾讯混元或者其他(比如字节豆包)的打 4。

有朋友问千问 3.8-27B 怎么样。这个模型我已经在本地跑出来了,也录了视频。简单给个结论:作为本地模型它比之前的模型好,幻觉也低,但不如我本地跑的 DeepSeek V4 Flash 2.4 比特量化版。它的好处是内存友好,4 比特量化只占 20G 左右,8 比特不到 40G;问题是它是 27B 的稠密模型,推理速度慢,在我的机器上每秒只有 30 多个 token——能跑,但不快。

一、国产 Flash 模型三天三连发:价格战开打

从 DeepSeek 涨价说起

这轮价格战其实是 DeepSeek 先动的。8 月份它把 Flash 和 Pro 的价格做了峰谷时段区分,价格直接翻了大约三倍,高峰时段更贵。这一涨价,DeepSeek 的日 token 消耗量一度跌到峰值的一半。

它空出来的这部分需求,马上被盯上了。这一周,三家国产厂商连续发牌。

第一张牌:GLM 5.3 Flash(牛来)

智谱很有意思。最近在 OpenRouter 上有一个霸榜的、很便宜的匿名模型,大家叫它「牛来」、Ox Alpha,都在猜它是谁——有猜小米 Mimo 的,有猜 GPT 的 Gemini 的。其实它就是 GLM 5.3 Flash,而且挺好猜的:智谱之前在 OpenRouter 上发布前一代 GLM 5.2 的时候,代号叫 Pony Alpha、小马、马来,这次叫牛来。

GLM 5.3 Flash 是 3200 亿参数,每次激活 180 亿,100 万上下文,原生多模态。价格只有 Opus 的四十分之一,现在促销期输入每百万 token 0.4 元、输出 1.4 元,几乎是全网最低价。它号称匿名测试期间的全部流量都跑在十万张国产芯片上——华为昇腾、海光、摩尔线程。评测成绩也是各种炸裂,把 DeepSeek 彻底碾压了。

第二张牌:千问 3.8 Flash

第二家是阿里千问。千问 3.8 Flash 参数小一些,1250 亿参数,每次激活 60 亿,但是千问 4 的下一代架构版本,也是一个非常先进的模型。

第三张牌:腾讯混元预览版

最后是腾讯,8 月 28 号发了混元的预览版,直接绑定自家的 WorkBuddy 和 CodeBuddy,上线前两周免费。

所以三天时间连发三个模型,目标一致:把价格斩杀到 DeepSeek V4 Flash 之下。「比 DeepSeek 更便宜」,成了国产模型的新赛道。

二、评测是参考,实测才是真相

我这周做了什么

评测数据是一回事,实际用起来是另一回事。这周我在自己的 Mac Studio M4 工作站上做了两件事:一是本地跑了三个模型——DeepSeek V4 Flash 2.4 比特量化、千问 27B 4 比特量化、千问 3.8 Flash 3 比特量化;二是把几个当红模型接进我真正在用的 Pi Agent 里,让它们执行同一个真实任务:控制 Chrome 浏览器,打开我的 YouTube 后台,分析网页、抓取数据,最后输出数据分析报告。

这不是跑分,是模拟真的给老板干活。

结果:速度与质量

结果非常清晰:

GPT-5.6 大概两分钟就执行完了,质量很好;DeepSeek V4 Flash 四分钟完成,质量也可以;千问 3.8 用了六分多钟,质量明显低一些;GLM 5.3 跑了整整十四分钟,质量比千问稍微好一点点。最后我还用 Kimi K3 测了一下,它这个任务根本跑不下来——不是模型笨,是基础设施太差,动不动就 overloaded 过载。

所以四个一线模型,我的座次是:DeepSeek V4 Flash 排第一,GLM 5.3 Flash 排第二,千问 3.8 Flash 排第三,Kimi 连上牌桌的资格都没有。这几个其实都是两三千亿参数、同一个级别的模型,跑分和实际使用完全不是一回事。

再看推理速度:DeepSeek V4 Flash 遥遥领先,每秒差不多 150 个 token;千问 3.8 Flash 慢很多,大概慢 50%;最夸张的是 GLM 5.3 Flash,号称有十万张国产卡,但推理速度极其的慢,每秒可能 50 个 token 都不到。

还要说一句:千问真的很会刷榜,榜单刷得让你觉得它极其炸裂,但真正执行任务的时候挺拉垮,既不如 DeepSeek 也不如 GLM。

中文场景的特殊性

这次实测我测的不是编程环境,而是中文语境下的办公场景——文档处理、抓网页、数据分析、做总结、跑 Agent 工作流。因为编程环境容错率低,我建议还是用 Opus 5.0、GPT-5.6 这类顶级模型;中文办公才是更广泛的应用场景。

而在这个场景里,GPT 有一个很大的缺陷:你不能让它输出大段中文,但凡输出大段中文,不管什么场景都极其拉垮。GPT 质量最好的还是英文语境,写代码、做逻辑分析都很稳定。所以大量中文语境下,用 OPAS 4.6 或者国产模型效果更好,而国产模型里中文最强的还是 DeepSeek。

当然差距要承认:国产模型距离海外的顶级模型,我觉得还有 6 到 12 个月的差距,还是差一代。评测榜单可以各种碾压,但复杂逻辑推理、高要求代码任务,顶级模型的优势依然明显。

三、英伟达:中国开源模型反而加深了它的垄断

财报炸裂 + 定制芯片潮

英伟达这周发布了史上最强的财报:数据中心业务 890 亿营收,单季营收 962 亿,各种炸裂。但同期大家都在说:OpenAI 推了自研推理芯片,各大 hyperscaler(最大的云厂商)也都在做自己的定制芯片——英伟达是不是要不行了?

我的判断

我的观点很明确:不会。因为我觉得,是中国的开源模型拯救了英伟达。

为什么?中国这帮开源模型做出来都是开源免费的。云厂商建设一个数据中心,里面放上开源模型,就可以对外卖 token。英伟达现在有一块业务,牵头一大帮叫 New Club 的中小型云厂商,去租土地、建机房,把 GPU 租赁给他们,支持他们运营数据中心,然后收租。这块业务增长很快,已经占到英伟达收入的 40% 了。

所以我的结论是:国产开源模型一代又一代变强,不管 Kimi、千问、GLM 还是 DeepSeek,其实都是在拯救英伟达,让它的垄断地位更加稳固。国产模型越强大,英伟达就越强大。

收购 Hugging Face 意味着什么

英伟达最近准备花 129 亿美元收购 Hugging Face——全球最大的开源 AI 模型社区,号称 AI 界的 GitHub。为什么?因为它想把开源模型社区握在自己手里:从开源模型的发布、托管,到云端 token 的售卖,把整个开源模型生态攥在手里。那样它就不只是一个卖 GPU 的,而是变成 AI Factory——开放模型的 token 工厂。英伟达的商业模式其实正在转型。

四、OpenAI 断供 Cursor:模型供应开始站队

这周还有一件很有意思的事:Cursor 被 Grok 收购之后,OpenAI 把它拉黑了,不允许 Cursor 里再用 OpenAI 的模型。Cursor 的老大回应说,GPT 模型在 Cursor 里的占比其实只有 5%。

我的观点是:Grok 后面可能也会很强大。Sam Altman 和 Elon Musk 两个人本来就互不对付,现在私人恩怨变成了产业级事件——模型供应第一次被当成武器来用。你用什么工具,背后可能就站了队。

五、我的工具栈:Pi Agent、Paseo 与 DeepSeek 本地部署

为什么我从 Codex、Claude Code 转到了 Pi

我现在用得最香的 Agent 是 Pi Agent,使用场景占到 80% 到 90%,Codex 占 15% 到 20%,Claude Code 几乎不用了,OpenCode 彻底不用了。

原因有三个。第一,速度:同样的 GPT 模型,在 Codex 里用明显慢,在 Pi 里快很多。第二,context 小:我的 Pi 只装了三个插件——memory(记忆)、web access(网页搜索、读图片视频)、MCP adapter(接 chrome devtools 控制浏览器),加载完 skill 后初始 context 只有 10k 左右;而 Claude Code 一打开空白就要 40k,每次交互都差 30k。第三,可定制性强:直接在配置文件里改,就能把所有模型接进来,不像 Claude Code 还要依赖第三方切换工具。

我在 Pi 里接了 13 个模型:GPT 系列(订阅套餐)、DeepSeek 三个(V4 Flash、Vision、V4 Pro,API 接入)、GLM 5.3 Flash、千问 3.8 Flash、Kimi K3,还有本地跑的 DeepSeek V4 Flash 2.4 比特、千问 3.8 Flash 3 比特、Onis 1.5 35B、千问 3.6 35B、千问 3.8 27B。开不同窗口随时切换,非常方便。

Paseo:远程工作台

Paseo 是一个开源软件(一个老外开发的免费开源软件),它不是 Agent,而是封装 Agent CLI 的工作台外壳。它把 Cloud Code、Codex、Pi、Grok 全都接进来,支持远程使用:电脑、手机、平板实时同步,你在服务器上开一个 Terminal,手机端同步打开。它还集成了文件浏览、代码查看、Git、Commit、GitHub 连接,几乎是一个工具搞定所有事。

Paseo 的多 agent 编排能力也很强:让 GPT-5.6 做主 agent 做规划,然后委派一个模型写代码,再委派 DeepSeek 做网页采集,最后再让一个模型做 code review。它会开多个 tab,每个子任务能看到进度,中间还能跟子任务对话,最后汇总回主任务。对我来说,这种多任务编排已经满足要求了,不需要自己开发复杂的东西。

DeepSeek 本地部署的实测细节

DeepSeek 这个模型本地跑起来很神奇。第一,模型占的内存很稳定,2.4 比特量化基本在 86 到 92GB 之间波动,不会像千问那样内存抖动大。第二,context 无论大小,decode 速度都很稳定,不会明显衰减;千问 context 一大,预填充和 decode 就陡峭下降。所以 DeepSeek V4 在推理上一定做了很强的优化,几乎不需要我从推理框架上再做什么。

量化方面:2.4 比特本地跑质量很稳定,但跟云端相比还是能感受到质量损失;4 比特会好很多,处理普通任务完全够用。我现在的用法是:高难度任务和编程用 GPT,中文处理和输出用 DeepSeek V4 Flash;但梁文峰的峰谷定价太讨厌了,空闲时段用 DeepSeek,高峰时段就拿千问 3.8 或者 GLM 5.3 顶一顶。

硬件推荐:新出的 Mac Studio M5 Ultra 512G 内存版,可以把 DeepSeek V4 Flash 满血版直接部署到本地——满血版也就 384B 参数、300 多 G 内存,M5 的内存带宽提升到 1.2TB/s,估计满血版推理也能达到每秒 60 个 token。预算有限的话,256G 的 M5 跑 4 比特量化版效果也会很好。

另外我不太喜欢 DeepSeek Harness:它目前还是一个草稿状态,只有 web 接口没有 CLI,没有 CLI 就没法做扩展。等它推出原生 CLI 我才会考虑用。

六、直播答疑

大模型端保存用户信息、做到有状态,可能吗?

纯粹的模型保存信息其实没必要,因为会影响模型性能。但基于模型的线上服务现在不就已经是有状态的了吗?豆包、ChatGPT 这些产品本身就保存了你的关键信息,有记忆能力。所以这不是能力问题,只是产品要不要提供这个功能。Agent 也是一样,Claude Code、Codex、Pi Agent 现在都有 memory 能力。

WorkBuddy 跟 Codex 差距大吗?

WorkBuddy 就是山寨版的 Codex。两个都能用的话就用 Codex;不能搭梯子的话就用 WorkBuddy。

怎么搭配模型?

你总归需要两个模型:一个顶级模型,用来做编程任务和高层级的规划决策,不管是 Claude 还是 GPT;还需要一个苦力模型,平常干活用。而在中文语境下 GPT 又很拉垮,所以你需要一个性价比高、推理速度快的苦力模型,我自己用下来最理想的选择就是 DeepSeek V4 Flash。

对 FDE 在国内发展有什么建议?

FDE 必然是一个趋势,但目前缺的是好的解决方案。Palantir 是先有它的 AIP 平台,再派 FDE;但国内现在一帮软件公司都在开发类似 AIP 的平台,我觉得这事是颠倒的——应该先做咨询项目、先干脏活累活,慢慢才能形成平台化的产品。我自己就把自己定义成一个 FDE,从咨询入手积累案例,再积累培训项目和可以产品化的东西,慢慢转型。先有案例,后有平台,这是我认为正确的路径。

端侧小模型怎么看?

端侧小模型不是一个通用模型,它一定是针对特定任务做优化的,我觉得有前途。至于国产芯片公司做对标 NV 的卡、基于开源 RISC-V 架构,这个我不了解,没有特别的研究。

如何看待韩国大模型全民医保?

韩国是一个发达国家,政府有钱,老百姓也有钱。我也希望大模型全民医保。

高峰期怎么省钱?

就是峰谷错开:高难任务和编程用 GPT,中文处理用 DeepSeek V4 Flash,高峰时段用千问 3.8 或 GLM 5.3 顶一顶。V4 Flash 普通人日常任务确实够用,但很复杂的任务还是有点力不从心,得用 GPT 的模型。

写在最后

这周国产模型各种连发,城头变换大王旗,但用下来你会发现,值得作为主力选择的还是 DeepSeek。千问很会刷榜但任务执行度偏差,GLM 和 Kimi 同一个问题都是算力不足,Kimi 已经到了不能上桌的地步。

明天我会再发一个评测千问 3.8 Flash 的视频,后面还会出一个整体的横向评测,欢迎大家关注。企业 AI 落地咨询方面有需求的朋友也欢迎联系我。

下周日晚上九点,我们继续聊。

本期金句

  • 你大爷还是你大爷,最强的模型还是 DeepSeek。
  • 评测数据可以刷,跑分跟实际使用完全不是一回事。
  • 连上牌桌的资格都没有,那说什么都白搭。
  • 国产模型越强大,英伟达就越强大。
  • 中文语境下,让 GPT 输出大段中文极其拉垮;这种活还是得用国产模型。