最近我一直在折腾一套好用的浏览器自动化的东西,因为实在是被繁琐的鼠标键盘流程给我搞怕了。浏览器自动操作、文章多平台发布、泛微OA自动审批。

  其实我需要AI帮我干的都是同一类事:让 AI 先帮我跑通自动化流程,并且录制成RPA程序,以后就是RPA程序替我在网页上点鼠标。 我对这个功能的渴望,是从2020年2月开始的,但我试过了影刀RPA、实在智能RPA、金智维等RPA工具,他们全都解决不了我的问题。

  直到AI Agent时代到来,我终于靠自己的想象力,用阿里Qwen3.8搞定了浏览器自动化的底座,用DeepSeek v4 flash正式版完成了无人值守且无需AI干预的自动化流程。接下来我需要的就是注意力和想象力了。

  我让它替我干的活

  作为白领牛马,我最头疼的就是在企业管理系统的网页上一个字段一个字段的填报,我觉得每天重复干这种工作,简直就是浪费生命,浪费智力,浪费灵感。比如每天批OA上一些纯流程性不用动脑子的待办,比如在IBM那个超级难用的报销系统里面一个字段一个字段填报销信息,还有往ERP系统里录入数据,以及从CRM系统里面查看用户画像并录入拜访记录,真的是恶心的工作……

  另外,在自媒体领域,我需要把我md格式的文章一次一次贴进微信、微博、知乎、头条、百家号、网易新闻、腾讯新闻的后台,然后处理各种渲染问题、排版问题,配置封面图等等,最后再手动发送。我写一篇稿子三小时,把这些网站全部发一遍,至少45分钟,然后我就会被这种重复性工作恶心得极度抗拒。

  我做了什么

  其实我做了两步。第一步,让我能够用命令直接控制浏览器。这里要感谢 openai 的思路启发,我的团队有同学把浏览器日常操作拆成五十来个动作:打开网页、截图、点击、填表、跑 JS。命令长这样:

  curl -X POST http://127.0.0.1:58081/api/tool/browser_navigate -d '{"url":"https://www.zhihu.com"}'
# 看看页面长什么样
curl -X POST http://127.0.0.1:58081/api/tool/browser_snapshot_ax -d '{"mode":"compact"}'
# 点一下那个按钮
curl -X POST http://127.0.0.1:58081/api/tool/browser_click -d '{"ref":"e12"}'

  这是一切的基础,也就是我们经常说的 AI 脚手架,或者叫驾驭工程。

  第一步完成了,就意味着我可以跟 AI 对话,让它生成控制浏览器的命令,在一个真实打开的浏览器上,模拟人类的点击、滚轮、键盘输入;如果遇到验证码,我还能手动干预一下。

  第二步,让 AI 帮我写完具体操作浏览器的命令组合,做好判断,处理好各类恶心的反自动化手段。比如在今天之前,我试过 8 个浏览器自动化工具包括 bbbrowser 等,没有一个能实现「自动选好问题,把我的图文内容发到知乎回答里」。

  听起来简单,难就难在「录制具体流程」这一步。AI要能自己处理弹窗、验证码、加载等待,要在千奇百怪的页面上都不迷路。尤其知乎那个富文本编辑器,是全平台最麻烦的东西:普通方式粘贴进去格式全乱,标题没字号、图片贴不进去、导入md按键无法弹出文件选择器。

  我之前试过好几个模型,都没法自动往知乎回答里面填入图片、渲染 markdown。直到 DeepSeek v4 flash,真的把知乎回答流程给我完成了。

  DS 的做法很巧妙地绕过了知乎那个富文本编辑器,它先把我的 Markdown 转成带样式的 HTML,塞进系统剪贴板,再通过浏览器级的按键组合全选、粘贴,标题、加粗、图片,全部原样进了编辑器。看着 DS 自己找问题、自己填、自己点发布,感觉很欣慰。

  千问帮我写了底层浏览器控制代码

  我让团队的小伙伴,帮忙调研了市场上的主要产品,做了一个浏览器控制的 MCP,并提供给公司员工使用。他前半段正确参考了 openai 做浏览器自动化命令的执行,后半段却做成了 MCP。他其实没明白我需要什么,MCP 不适合企业浏览器自动化,因为它只能一条一条顺序执行,做不了快速的自动化。

  我要的很简单:在 Ubuntu 上打开一个真实的浏览器,登录我自己的账号,然后让 AI 替我把命令组合执行下去。 周五我把源代码要过来,用 Qwen 3.8 按我的思路重写了一遍,不到两个小时,就完整实现了我想要的功能。所以这个时代,灵感和洞察最重要,代码不值钱了。

  Qwen 3.8 是阿里云最新发布的 2.4 万亿参数的旗舰(Qwen3.8-Max 全解析[1]),优点是最近白天打 1 折,晚上打 0.02 折,约等于既聪明又不要钱。我对它说清楚要什么,它就自己完成了主要工作:五十来个操作、一个对外接口、还有各种踩坑的细节处理,不但听我指挥,还思路清晰,速度飞快。放以前,这种活要跟工程师磨十几天,因为大家要互相理解,他要开发,我要测试;而现在,跟模型说清楚就行。

  最近 qwen 模型打一折,真的相当便宜,便宜到我敢让它写上万行代码,敢让它反复试错,写坏了重来,不心疼。那些 100 万 tokens 要 100 块的模型,我就舍不得这么乱探索了。毕竟如果一天烧 500 块钱自费 tokens,还是太贵了。

  贵到用不起

  顺便说说 Kimi K3。K3 今年 7 月刚发布,2.8 万亿参数,100 万上下文,发布当天就冲上全球前端代码榜第一(Kimi K3 发布解析[2])。强是真强。可问题是贵:官方定价输入百万 token 3 美元,输出百万 token 15 美元,缓存命中才 0.3 美元(Kimi K3 定价[3])。

  缓存命中才便宜,这话是重点。 缓存命中意味着同样的前缀反复用。我的日常任务,每次读的网页都不一样,哪来的缓存命中?等于那个便宜价,我根本够不着。实打实按输出价走,百万 token 一百来块人民币,就这么没了。

  一百块一百万个 token。我批一天 OA、发一篇稿子,烧进去二百万 tokens,合着 200 块钱打水漂,那还不如我自己操作了。一天几块钱的模型才叫工具,一天 200 块的模型那还不如养个员工。

  不是 K3 不好。是我用不起。

  今早的DeepSeek,封神

  真正让我决定写这篇自来水的,是今早DS flash太顶了。

  昨天我的 Qwen3.8 Max Preview 到期不能用了,我改用 DeepSeek v4 Pro,基于我的浏览器控制基座搞自动发布的流程自动化。结果搞了半天,卡得死死的:内容粘进去格式全乱,标题没标题、图片错位,发布按钮点了没反应,有时候验证码一弹,整个流程就卡死。我一度怀疑是不是我的基座有问题。

  然后我在去机场的路上,看到朋友圈里大家都在说昨天刚公测的 DeepSeek v4 flash 特别好,我也就随手试试(DeepSeek V4-Flash 公测解读[4]),想着反正便宜,就试试呗。结果呢?两个小时的路上,它真的把流程给我干出来了,比 V4 Pro 还聪明! 我一共才充值了 20 块钱,到现在还没用完!

  昨天换过 K3、Opus 5.0 和 DS v4 Pro,都没搞定知乎回答的自动化发布。今早切到 V4 Flash,看着它用我的浏览器控制基座,直接跑通了。这证明不是我的思路不行,是之前的AI不趁手

  DeepSeek V4 Flash,284B 参数的 MoE 架构,MIT 开源,输入价百万 token 只要一块钱人民币。更难得的是能力:纯靠后训练,把 Agent 能力整整提升了 7.5 倍,终端操作水平 82.7 分,已经摸到国外旗舰 85 分的门槛。

  一块钱,一百万 token。一块钱我能在里面翻几十个网页,让它看几十遍屏幕,反复试错。这种感觉,贵模型给不了。

  今早我已经实现了把一篇 md 格式的文章,自动化分发到多个平台。这是我从 2020 年 2 月就开始想要的功能,终于还是靠自己实现了。

  浏览器里的百家号后台,也是 AI 自己开着填的。整个过程我就在旁边看着,说了一句话。

  便宜,才是T0

  说到这,说一个我的暴论。判断一个模型是不是版本 T0,不看它最强的时候多强,看它最日常的时候你舍不舍得用。 最强模型再厉害,你一个月用两次,一次省着算 token,它对我就是没啥大用。

  一个够聪明而且价格不贵的大模型,我能天天用、处处用、脏活累活全塞给它,毕竟大部分工作不需要最高水平的人工智能。物美价廉的大模型,也就是 DeepSeek V4 Flash,才是我真正的生产力,是我的办公搭子。

  agent 任务尤其如此。看页面、点按钮、读表格,这些操作本身不需要神仙智力,需要的是稳定地按要求执行。而 V4 Flash 聪明程度达到了 Opus 4.8 的水平,价格连官方价格的百分之一都不到,那你说我们该选谁?

  几百块的SaaS,20块就干掉了

  2021 年我买过一款多平台分发的工具,融媒宝,一年几百块。难用到什么程度?还是要手动一个个平台点一下,才能把一个个文章同步到草稿箱、发件箱,而且很多平台还不适配,它只是把我点鼠标的时间省了一点点。几百块一年,买的就是便利一点点,本质上还是很难用。

  现在我这套方案呢?扫码登录一次,剩下是程序全自动。让 AI 自己找问题、自己发文章、自己批 OA,几十块的一次性 API 成本,干的活比那个一年几百块的家伙好多了。

  这是今天的真实发布记录,头条、百家号两条,都是 AI 自己发出去的。

  你猜这种 SaaS 公司,还有 RPA 公司现在慌不慌。它们的产品价值,就是「帮你省那点手动操作」。现在模型白菜价了,自动化需求还在,用户花二十块钱就能自己造,你说它们该干啥去,靠啥挣钱?

  AI 时代,旧方案的价格体系和定价模式,全部被重构了。

  这才是真正的贡献

  这个时代,足够聪明加上足够便宜,才是版本 T0。 不是最强,不是最全能,是那种你舍得拿它干日常脏活、天天跑也不心疼的模型。谁家的模型能做到这个,谁就是当下版本的神。

  DeepSeek 这家公司,对中国、对整个人类的贡献,都是最大的。为什么?因为它把「强」和「便宜」这两个词,第一次同时摆在了所有人面前。 开源、白菜价、能力在线,三个条件同时成立。这意味着什么?意味着 AI 的能力,第一次真的落到了普通人手里。不用是公司,不用有大预算,一个像我这样自己折腾的个体,都能用得起、用得上、用得好。

  这才是技术该有的样子。最强的技术不是被少数人捧着的,是能被所有人拿起来干活的。

  我不是说别的模型不好。K3 很好,我心疼的是它太贵。但版本 T0 这个位置,今早开始,我投 DeepSeek V4 flash和千问3.8 max。又聪明又便宜,这俩词凑一块,就是版本答案。

  感谢deepseek大善人,感谢阿里大善人!!感谢中国开源生态贡献者,相信中国必然会成为世界AI的领导者,因为物美价廉没有人能抗拒啊哈哈哈哈哈。

  参考资料 & 外部链接[1] Qwen3.8-Max 全解析: https://developer.aliyun.com/article/1749296[2] Kimi K3 发布解析: https://www.cnblogs.com/rangsh/p/21577817[3] Kimi K3 定价: https://blog.csdn.net/ylscode/article/details/162975689[4] DeepSeek V4-Flash 公测解读: https://www.aitoollab.cn/articles/deepseek-v4-flash-agent-open-source-2026/