范凯说 AI · 周日晚聊 第31期:从模型追逐到 AI 业务落地

AI直播DeepSeekQwenAgent企业AI本地部署

开场

大家好,今天是《范凯说 AI · 周日晚聊》第 31 期。

这周 AI 行业最有意思的地方,还是模型越来越多、越来越强,但真正让人关心的东西已经慢慢变了。以前大家总在讨论哪个模型最强,现在更多人开始问:这个模型能不能放进我的工作里?能不能稳定地跑 Agent?最后能不能真的帮我解决问题、赚到钱?

这周我自己也在折腾几件事:看 DeepSeek 的价格变化和 Harness,实测了 Qwen 3.8-27B 的本地部署,也在想企业 AI 到底应该怎么落地。今天就顺着这些事情聊一聊。

一、DeepSeek 调价之后:模型之外,还有推理基础设施

价格变化与 V4 Flash Vision

8 月 17 日,DeepSeek 做了一次比较大的调价。缓存没有命中的请求,平均涨了三倍左右;缓存命中的话,涨幅大概是十倍。它现在还做了峰谷定价:工作日早上 9 点到 12 点、下午 2 点到 6 点是高峰期,其他时间价格会低一些。

我自己用下来,高峰期确实挺贵,大概是原来价格的四倍;低谷期涨到两倍多,倒还能够接受。现在周末也按低谷价格算,只有工作日的上班时间是高峰。这个设计跟电价有点像,周末如果要大量使用,成本会舒服很多。

V4 Flash 本身我还是愿意用的。它速度快,中文表达也比较顺,常规任务基本够用。问题是它的思考过程特别消耗 Token,稍微多跑一会儿,几百万 Token 很容易就没了。V4 Flash Pro 的价格贵了一倍,但性能没有明显提升,所以我没有把 Pro 当成主要选择。

最近 DeepSeek 又推出了 V4 Flash Vision,补上了原来不能识别图片的短板。现在它还是测试版本,只能在 DeepSeek Harness 里面调用。我自己试了一下,至少从体感上看,性能没有明显下降,整体还不错。

DeepSeek Harness 和开源模型的生意

DeepSeek Harness 发布以后,社区的反应非常快。我看到的情况是,第三方插件已经超过 2700 个了。你随便去搜,很多常见功能都已经有人做成插件接进去了,生态的生长速度确实超出我的预期。

这里面有一个问题挺值得聊:开源模型到底怎么赚钱?

DeepSeek 涨价以前,OpenCode 曾经推出过一个很便宜的套餐,首月 5 美元,之后每个月 10 美元,几乎可以不限量使用 V4 Flash。DeepSeek 涨价以后,OpenCode 就尝试自己部署服务器,或者租算力来跑,想把成本压回去。但从 17 号折腾到直播这周,差不多一周时间,它还是没有真正把执行成本降下来。

这件事让我意识到,手里有一个好模型,不等于你就能把它跑好。模型后面还有一整套推理基础设施,包括硬件、软件、缓存和各种推理优化。DeepSeek 官方显然针对自己的模型和算力中心做了很深的定制,所以它在自己的基础设施上能把成本压得很低。第三方就算拿到同一个开源权重,也很难把效率完全复现出来。

所以开源不代表原厂没有生意。原厂真正卖的,可能不是一个单独的模型,而是“模型加推理基础设施”之后的整体性价比。只要用户觉得在原厂使用更便宜、更稳定,最后还是会回到原厂买 Token。

二、挑模型的心态:从追最强变成算性价比

我平时会偶尔翻一下 Artificial Analysis 这类榜单,大概了解各家模型在什么位置。但榜单更多只是帮你建立一个印象,真到干活的时候,不能只盯着智能指数。

平时我主要还是 GPT 配 Codex,DeepSeek V4 Flash 放在 Claude Code 里面做辅助。X Premium 里有 Grok Light,Google AI Pro 里也可以试 Gemini Flash 3.7,这两个我会偶尔用用,更多是探索性质。Claude 账号用了三年多,后来因为问了一个敏感问题被封,这件事也让我更清楚:工作能力不能押在一个账号上,手里最好有备用方案。

现在大家挑模型的心态确实变了。以前总问谁最强,现在更关心谁最划算。只要模型跨过那条“斩杀线”,常规任务就已经做得不错,没必要每件事都扔给最贵的模型。

DeepSeek V4 Flash 在我这里已经过了这条线。一般的工作,尤其是不需要特别深度思考的任务,它的表现已经让我很满意。有时候它的遣词造句甚至比 GPT 5.6 更符合我的习惯。日常工作就用便宜、够用的模型,遇到复杂规划、深度思考或者代码审核,再切回高端模型,这样用起来更合理。

三、Qwen 3.8-27B:本地能跑,不等于业务里就好用

为什么一个 27B 模型会这么受关注

千问 3.8-27B 最近很火,原因很简单:它是一个只有 270 亿参数的稠密模型,却在 Artificial Analysis 上拿到了 52 分,挤进了通常由千亿、万亿参数模型占据的区间。

一个这么小的模型,跑分能够摸到 Opus 的边,当然很让人兴奋。但跑分漂亮,不代表实际能力已经全面对标。参数量差了两个数量级,能力上限、稳定性和复杂任务的表现,还是不能简单画等号。

我在 Mac Studio 上的实测

我自己在 Mac Studio M4 Max、128GB 内存的机器上跑了一下。苹果电脑上用 MLX 和 OMLX 比较方便,Qwen 3.8-27B 的 4 比特版本占用大约 15GB 内存,8 比特版本大约 27.5GB。我也把 DeepSeek V4 Flash 的 2.4 比特量化版本放进去试过,86GB 左右,能够运行,但速度明显慢一些。

Qwen 3.8-27B 4 比特版本配合 Flash Decode 优化以后,生成速度大约每秒 40 到 50 个 Token,Prefill 是每秒 200 多个。上下文一长,生成速度会掉到每秒 30 多个。做普通问答、写东西、查知识库,这个速度已经可以用了;但如果让它跑一个很长的、多步骤的 Agent 任务,等待感还是比较明显。

之前我也测试过 Qwen 3.6-35B-A3B。它是 MoE 模型,每次只激活 3B 参数,内存占用大概 19GB。在我的机器上,Prefill 可以到每秒 1000 多个 Token,生成速度 80 到 90 个,跑 Agent 的时候几乎感觉不到比云端慢。它的问题是模型能力弱一点,遇到复杂任务更容易飘,出现偏移和幻觉。

所以不同模型适合的场景不一样。27B 版本幻觉少,多模态能力也更强,适合本地多模态 RAG、隐私要求高的场景,或者相对复杂的任务。35B-A3B 更适合拿来做日常执行,速度快,交互感好。如果是 NVIDIA 的高带宽显存,27B 跑到每秒 70 个 Token 以上是有机会的;但 Mac Mini 这种设备,跑大模型容易受内存和带宽限制,主要做执行任务的话,优先考虑小一点的模型或者 MoE 版本会更实际。

本地推理还在快速优化,草稿模型、KV Cache、SSD 加速、Prefill 和 Decode 都有继续提升的空间。未来桌面硬件再升级几代,普通任务完全交给本地模型,应该不会像现在这么勉强。

但至少现在,不能因为一个模型跑分接近 Opus,就把它当成云端顶级模型的平替。“能在本地跑”和“能稳定驱动业务”,中间还隔着速度、上下文、权限、数据和验收这一整套东西。

四、企业 AI:工具只占 20%,剩下 80% 要回到业务

如果真想靠 AI 做点生意,工具这件事花 20% 的精力就够了,剩下 80% 得用来找客户、啃需求。

国内企业正在从“前 AI 时代”往业务端 AI 化过渡。前一个阶段,是让每个员工自己试用 AI 工具;现在企业开始关心,怎么把 AI 放进客服、订单管理、营销、知识库和内部流程里,把原来靠人或者传统软件完成的流程,改成 Agent 自动化的工作流。

这也是为什么最近很多人开始讨论 FDE,也就是前线部署工程师。光会玩工具没用,得真正坐到客户旁边,把业务流程拆成一个个具体场景和案例卡,再通过一次次交付,把这些东西沉淀成自己的案例库。做到这一步,才有机会从 FDE 进一步变成咨询顾问。

这件事我自己也正在做。现在做企业咨询和培训,重点就是把客户的真实业务抽出来,看看哪些环节可以从手工流程或者传统软件,转成 Agent 工作流。以后如果积累的案例足够多,就可以把它们整理成企业 AI 转型课程,再和更多 OPC 合作,让合作伙伴进入企业完成交付和部署。

这个市场目前还比较分散,不是某一家头部公司可以全部吃掉。企业服务本来就重人工,真正重要的是你能不能把客户的问题弄清楚,把几个案例实实在在跑通。

软件已经不再稀缺了。Agent 流行以后,很多软件很快就能搭出来,客户真正需要的也不是又一个通用 Agent,而是有人能把这些模型和工具放进他的业务里,最后稳定跑起来。更现实的路径,是先从培训和咨询进入企业,弄清楚哪些工作流值得改造,再提供工具、部署产品和定制工作流,而不是先憋一个通用 SaaS 等客户来买。

五、直播答疑

本地 Qwen 适合搭配 Codex 吗?

主要还是看硬件。如果 Decode 能到每秒 70 个 Token 左右,Prefill 能到每秒 500 到 700 个,搭配 Codex 就比较顺;如果本地模型跑得太慢,Agent 的交互会非常卡。

代码评审能不能完全交给 AI?

目前还做不到全自动。比较实际的做法是交叉验证:模型 A 写代码,模型 B 做评审,最后还是需要人工把关。

OX Alpha 是不是国内模型?

这个目前只是我的个人判断,不是已经确认的事实。我倾向于认为它来自国内,而且可能和智谱 GLM 有关,主要是因为智谱首席生态官刘江之前在社交媒体上的一些暗示,再加上命名方式比较像。

AI 量化交易适合个人做吗?

我认识的几个团队都在做 AI 量化,但这件事本质上是资金和团队的博弈。按照我从业内朋友那里听到的算法,三千万元资金大概只够养一个人的成本,一个五人团队就要准备一点五亿元左右的资金规模。

而且量化还有一个很麻烦的地方:如果大家都用相似的方法挖因子,因子的有效期就会变得很短。第一批人站起来,后面的人也跟着站起来,最后就成了“电影院效应”,只能不断追新的因子。

没有行业背景、团队和资金,我不建议个人直接下场做 AI 量化。如果看好前沿 AI 公司,个人可以考虑自己能理解的价值投资方式,但这是个人观点,不构成投资建议。

企业客户从哪里来?

朋友圈、以前的同事、朋友介绍、线上内容带来的知名度、主动找上门的客户,或者线下机构合作,都可能成为渠道。刚开始不可能一下子就有很多客户,还是得持续接触真实企业,先把业务弄明白,再判断哪些流程值得做 AI 化。

医疗、金融和教育领域有什么机会?

如果没有行业背景,这三个领域我会比较谨慎。

医疗行业监管很严,诊疗本身未必是医生、医院或者药企最愿意付费的痛点。医生更现实的需求可能是论文和职称,医院关注医保控费和获客。AI 辅助诊疗可以帮助普通人管理自己的健康档案,但具体能不能商业化,还是要看合规和真实痛点。

我过去在互联网医疗公司工作过很多年,最后没有继续做这个方向,主要就是发现自己很难在行业痛点上形成优势。医疗行业真正能赚钱的地方,往往不是看上去最有技术感的地方。比如帮医生写论文、解决职称评审,可能比做一个 AI 诊疗产品更接近真实付费需求。

金融行业的银行系统体量很大,个体很难切进去;证券业务又高度集中到量化,需要很强的行业背景和资金。教育行业里,K12 确实是家长愿意付费的刚性需求,但刷题式教育不是我认可的方向,所以我没有进入。AI 教育到底有没有机会,我目前更愿意观察企业培训,而不是急着做学生端产品。

审计和财税是每家公司都会遇到的需求,海外报税流程相对固定,或许更容易标准化。面向出海和跨境电商提供财税工具或服务,反而是一个值得继续观察的切口。

六、Paseo:把分散的 Agent 工具放进一个工作台

我现在每天用得最多的软件之一是 Paseo,网址是 paseo.sh。它不是一个独立的 Agent Harness,更像是一层工作台外壳,直接调用电脑上已经装好的 Codex CLI、Claude Code CLI、OpenCode CLI、Pi Agent 和其他工具。

我把 Claude Code、Codex、Pi、Grok 都接了进去。不同 Session 可以切不同模型,也能在手机、电脑和平板之间实时同步。文件浏览、代码查看、Git 操作、多工作目录,这些功能都在里面。我的工作文档、知识库、咨询资料、Personal CRM、健康记录和写作内容,也都可以放在同一个个人工作台里。

Paseo 真正让我觉得方便的,是它把远程工作这件事做得比较顺。我把 CLI、知识库和完整工作环境都放在 Mac Studio 工作站上,手机和笔记本只要安装 Paseo、绑定设备,就能调用同一套环境。不用每台设备都重新配模型和工具,手机也不需要搭一套完整的开发环境。

连接可以走局域网、Tailscale 或官方中继,也可以自己在腾讯云 VPS 上搭一个中继节点。局域网和自建中继速度更快,官方中继则比较省事。电脑上做到一半,合上电脑拿手机接着跑;手机切到平板,还是同一个 Session,工作不会被设备切换打断。

写在最后

模型和 Harness 的能力发展到现在,已经足够覆盖大多数常规任务了。Codex、Claude Code、DeepSeek Harness,甚至国内的一些工具,做普通工作都已经可以用,没必要每天追着新工具跑。

真正值得花时间的,是找到客户,把需求定义清楚,亲手做出几个能跑通的真实案例。模型再强,如果没有进入业务,最终也只是一个漂亮的演示。工具够用以后,就别一直磨刀不砍柴了。

软件已经不稀缺,真正稀缺的是懂业务、能落地、有案例的人。对我来说,接下来更值得投入的事情,就是把 AI 放进现实业务里,解决具体问题,再看看这些经验能不能沉淀成长期可持续的服务。

本期金句

  • “能在本地跑”和“能稳定驱动业务”,中间还隔着速度、上下文、权限、数据和验收。
  • 工具花 20% 的精力就够了,剩下 80% 要用来找客户、理解需求和积累案例。
  • 软件已经不稀缺了,真正稀缺的是懂业务、能落地、有案例的人。
  • 工具够用以后,就别一直磨刀不砍柴。