摘要:本文以第一人称视角,记录从 Codex 全面切换到 Kimi Work 的真实使用体验。文章先讲清 Codex 国内使用的四个痛点(网络、账号、支付、合规),然后逐项深度体验 Kimi Work 的核心能力:Goal 模式从 " 指挥它做 " 到 " 告诉它要什么 " 的交互范式转变,Agent Swarm 超 300 个 Agent 并行处理批量任务,WebBridge 作为浏览器自动化 Agent 而非搜索摘要,定时任务到点自动执行,专业数据库原生接入,多格式文档生成,插件与本地文件集成。文章也坦诚列出 Kimi Work 的不足,并给出适合与不适合人群的判断。桌面 Agent 的真正价值不是 AI 更聪明了,而是 AI 终于能跨过聊天窗口直接帮你干活了。

这是 AIHOT 大模型排行榜的最新总榜,8 月 25 日更新,综合了 7 家公开榜单的共识评分。前五名里,Claude Fable 5、Claude Opus 5、GPT-5.6 Sol 占据前三,第四名是 Kimi K3——AIHOT 共识分 79.8,评测完整度 84.5%。但更值得注意的是价格那一列:Kimi K3 输入成本 ¥20 每百万 Token、输出 ¥100 每百万 Token,而 Claude Opus 5 是 ¥33.61 和 ¥168.07,GPT-5.6 Sol 是 ¥33.61 和 ¥201.68。Kimi K3 在能力排名第四的同时,价格只有头部模型的一半到三分之一。但光看榜单和价格不够,真正决定你要不要换的,是你每天用它干活时的真实体验。

用了大半年 Codex,2026 年夏天我彻底换成了 Kimi Work。不是因为 Codex 不好,而是在国内用它的综合成本太高 —— 代理断连、账号过期、支付折腾、数据出境心里没底。换之前我也犹豫,怕能力下降影响工作。用了一个月,这篇文章讲讲真实体验。
一、Codex 的四个痛点,每个都踩过先说清楚我为什么换。
第一个痛点是网络。Codex 的 OAuth 登录页面在国内经常打不开,代理节点时好时坏。有时候急着用,登录环节就卡十分钟。CLI 稍微好一点,但 Responses API 在国内中转站兼容性差,经常出现配置好了但 Agent 功能跑不起来的情况。
第二个痛点是账号。ChatGPT 账号注册要海外手机号,2026 年风控收紧后共享账号成片被封。我买过一个共享号,用了两周就登不上去了,之前的会话记录全没了。
第三个痛点是支付。ChatGPT Plus 每月 20 美元,虚拟信用卡要手续费,汇率转换有损耗,算下来实际成本远不止 20 美元。而且虚拟卡随时可能被拒付,续费断了就用不了。
第四个痛点是合规。我做内容运营,会接触未公开的业务数据和合作方文件。把这些东西发到境外服务器,公司后来明确要求不能用未经安全评估的海外 AI 工具处理工作文件。这是让我下决心换的关键原因。
这四个痛点叠加,让我觉得继续用 Codex 的性价比越来越低。不是它能力不行,是使用成本和风险已经超过了它带来的效率提升。
二、Goal 模式:从 " 指挥它做 " 到 " 告诉它要什么 "Kimi Work 给我的第一个不同感受是 Goal 模式。
以前用 Codex,我的角色是指挥官。做一份竞品调研,我得说 " 先搜这五家公司的官网 "" 把定价信息复制出来 "" 整理成表格 "" 写成文档 ",一步一步盯着。每一步都要我发出指令,AI 执行完等我下一步。
Goal 模式把我的角色变了。我只说要什么、什么算合格、有什么限制,它自己想办法完成。
第一次试,我给了一个真实任务:" 分析国内五款桌面 Agent 产品的定价和核心功能,输出 Markdown 格式报告,每个产品覆盖定价、核心功能、目标用户三个维度,信息来源限官网,无法访问的标注出来。" 然后我去开了个会。
一个小时后回来,报告已经生成了。它通过 WebBridge 逐个打开官网,提取定价和功能信息,有一家官网改版导致页面结构变化,它标注了 " 部分信息可能不完整 "。我核对了一遍,信息基本准确,只有一处定价是旧的,手动改了。
这种体验的差别不是 AI 变聪明了多少 —— 模型能力大家都在同一梯队 —— 而是交互范式变了。你从 " 一步步指挥 " 变成 " 定义目标验收结果 "。省下来的不是打字时间,是认知负荷:你不需要把任务拆成 AI 能执行的步骤,只需要想清楚自己要什么。
Goal 模式也不是万能的。我后来发现,Goal 写得越模糊结果越差。" 帮我做个调研 " 这种指令出来的东西没法看。把目标、验收标准、约束条件写清楚后,效果明显提升。一个可靠的 Goal 通常包含五个要素:结果是什么、验收证据是什么、范围约束是什么、预算限制是什么、失败了怎么处理。
Goal 执行过程中可能调用多个 Agent 协作,具体任务分配由系统自动调度,我不需要关心内部怎么分工。整个过程可观察、可介入,我可以随时查看中间结果、调整方向或停止。它不会盲目地朝一个未定义的目标一直跑。
三、Agent Swarm:300 个 Agent 一起干活另一个让我印象深刻的是 Agent Swarm。
有一次需要从 150 多份 PDF 合作协议里提取甲方、乙方、金额、签约日期、到期日期,汇总成 Excel。用 Codex 做这件事,我得写 Python 脚本、调试 PDF 解析库、处理各种格式异常,本质上是指挥它写一个数据处理程序。
在 Kimi Work 里,我写了一个 Goal:" 读取合同文件夹里所有 PDF,提取甲方乙方金额签约日期到期日期,汇总成 Excel,按到期月份分 sheet。" 它启动多个 Agent 并行读取,二十多分钟后 Excel 已经存到桌面了。有十几份扫描件识别不准,它标记出来让我核对,没有瞎填。
Agent Swarm 最多支持调用超 300 个 Agent 协同工作。面对大批量任务,系统自动唤醒多智能体网络,把大任务拆成子任务并行处理,最后汇总结果。这里没有所谓主 Agent 在指挥,Agent 之间根据任务需要动态协作,怎么分工由系统决定,用户不需要关心内部调度。
这种能力在批量场景下价值明显。一次性分析几十家竞品的官网信息、处理上百份文档提取关键数据、扫描大量论文做文献综述,串行处理可能要几小时,多 Agent 并行可以大幅缩短时间。
当然,信息提取难免有误差,尤其是扫描件和格式不规范的文件。Kimi Work 会把不确定的地方标记出来,而不是瞎填。这一点比给你一个看起来完整但有错的结果要好得多。
四、WebBridge:操作浏览器,不是搜摘要还要说的是 WebBridge。
很多人把 WebBridge 理解成 " 联网搜索 ",这是误解。WebBridge 本身就是一种 Agent,它实际操作浏览器 —— 打开网页、点击链接、填写表单、等待加载、抓取动态内容、下载文件。它沿用你浏览器已有的登录会话,能访问需要登录才能看到的内容。
这跟模型联网搜索是两回事。联网搜索是调搜索引擎 API 拿文本摘要,你拿到的是二手信息,可能过时、可能不完整、可能搜不到动态渲染的内容。WebBridge 是实际打开浏览器,看到完整渲染后的页面,执行真实操作。
我用 WebBridge 做过一个事:在一个后台系统里批量导出 30 份数据报表。这个系统没有 API,只能手动点击 —— 登录、选日期、点导出、等下载、重复 30 次。WebBridge 像真人一样操作,点击、等待、下载,中间有两次页面加载超时,它自动重试了。四十多分钟搞定,我去做别的事了。
在 BrowseComp 浏览器操作基准测试中,Kimi K3 得分 91.2。这个基准衡量的就是真实浏览器操作能力,不是搜索能力。
WebBridge 也有局限。有些网站用了复杂的反爬机制或非常规前端组件,WebBridge 可能找不到元素或点击位置不对。它会重试和报错,但不是每次都能成功。这是所有浏览器自动化工具的共同局限,不是 Kimi Work 独有。
五、定时任务:到点自动干活还有一个能力是定时任务,这是 Codex 不具备的。
Codex 是交互式工具,你叫它它才动,没有定时执行功能。你想让它每天早上自动生成一份行业早报?得自己搭 cron job 或 GitHub Actions,配置成本不低。
Kimi Work 内置定时任务引擎,就一种模式,设定时间和频率后到点自动执行 Goal。免费版可以设置 2 个定时任务,随套餐升级可设置更多。可以手动创建,也可以直接用自然语言说 " 每天早上 7 点半生成 AI 行业早报 ",系统自动转换为定时任务。
我设了一个每天早上 7 点半的早报任务,自动抓取几个 AI 行业信息源,按类别整理成早报存到桌面。到公司打开电脑就能看到。偶尔有信息源网站改版导致抓取失败,它会在报告里标注哪条没抓到,不会静默失败。
这个能力看似简单,但它让 AI 从 " 你叫它才动 " 变成了 " 它主动干活 "。每天重复的信息收集、每周固定的文件整理、每月例行的数据汇总,设定一次就持续运行,不需要人介入。
六、专业数据库和文档生成除了上面四个核心能力,Kimi Work 还有两个对知识工作者特别有用的功能。
专业数据库原生接入。金融方向接同花顺,企业信息接天眼查,法律方向接华宇元典。这些是直连数据库,不是去网页搜索,数据结构化且准确。做金融分析的,不需要自己找数据源、手动导出再导入,一个请求就能从原始数据推进到分析报告。在 Finance-Bench 金融分析基准测试中,Kimi K3 得分 62.6。
文档生成支持 PPT、Excel、PDF、Word 等多种格式。做方案、做汇报、整理会议纪要,直接输出可用格式。在 DECK-Bench 演示文稿测试中 Kimi K3 得分 73.5,Online Exp Bench 在线任务测试中得分 75.5。做出来的 PPT 不算惊艳但结构完整、排版可用,省掉大量调格式的时间。
插件生态支持飞书、钉钉、WPS、Notion、百度网盘、Canva、Cloudflare 等主流服务。需要说明的是,插件和技能是不同概念:技能是封装好的可复用工作流,Hooks 是关键节点自动执行的脚本,MCP 是连接外部工具的协议,插件是把 Skills、Hooks 和 MCP 配置打包在一起的完整能力包。即使不装任何插件和技能,Kimi Work 的核心能力也是完整可用的,不存在能力固定不变的情况。
本地文件深度集成也是一个实用功能。可以关联本地文件夹,直接读写处理文档、表格、PDF;支持自定义看板组件,把信息固定在桌面随时查看。
七、Kimi Code 和 API:编程和定制的补充 Kimi Work 不是为重度编码设计的。偶尔写个脚本、改个配置没问题,但如果你每天 8 小时写代码,应该用 Kimi Code。
Kimi Code 是独立的 AI 编程工具,CLI、VS Code 插件和 web 端三种形态,默认 K2.7 Code 模型可切换 K3,支持 Plan 模式、goal 模式、Sub-agents、Agent Swarm、HighSpeed 高速模式。它跟 Codex CLI 的使用方式一致,是编程场景的直接替代。
一个会员,Kimi Work 和 Kimi Code 都能用,具体权益和配额以各产品页面为准。在 Kimi Work 里遇到重度编码任务,可以切到 Kimi Code 处理。
需要把 AI 能力嵌入自己的工作流时,Kimi API 提供标准 HTTP 接口,按 token 计费。可以在 CI / CD 里加自动代码审查,写脚本批量处理代码或文档,在内部工具链接入 AI 能力,编排自动化工作流。比如 Kimi Code 写完代码后,通过 API 触发 Kimi Work 生成更新日志,再推送到团队协作工具。
八、其他国产方案简评试 Kimi Work 前后我也看了几款其他产品,简单说说。
TRAE 是字节跳动的 AI 原生 IDE,全称 The Real AI Engineer。TRAE IDE 国内个人版免费,适合习惯完整 IDE 环境、希望 AI 深度融入开发流程的开发者。
QoderWork CN 是阿里 Qoder CN(阿里旗下,与通义灵码并行)的办公端,本地优先架构,文件操作在本地完成,支持多模型切换和 MCP 协议扩展,适合对数据本地化有较高要求的用户。
WorkBuddy 是腾讯 2026 年 3 月推出的全场景 AI 办公工作台,跟 CodeBuddy 同属一个产品矩阵,深度集成企业微信和腾讯文档,适合已在腾讯生态内的团队。
这几款各有侧重,但 Kimi Work 在 Goal 模式成熟度、多 Agent 协作规模、浏览器自动化能力和专业数据接入的完整性上,是我用过的综合能力较为全面的选择。
九、Kimi Work 做不到的事说了好的,也要说不好用的地方。
复杂网页操作偶尔会失败
反爬机制强或前端组件非常规的网站,WebBridge 可能找不到元素。
Goal 模式对目标描述质量要求高
写不清楚目标,它会在错误方向上跑很久。建议复杂 Goal 先跑一小轮看方向对不对。
插件生态还在成长
已支持飞书、钉钉、Notion、WPS 等主流服务,但一些小众工具和垂直领域还没有官方插件。
编程能力不如专门的编程工具
Kimi Work 能写代码、改文件、跑测试,但日常重度编码应该用 Kimi Code。
长任务稳定性有提升空间。连续运行数小时的 Goal 偶尔会在某个环节卡住,需要人工介入。这是当前所有桌面 Agent 的共同问题。
十、适合谁,不适合谁适合 Kimi Work 的人:工作以信息处理为主的知识工作者 —— 运营、市场、产品、咨询、金融、研究、法务。需要定时自动化的人。有合规要求、数据不能出境的职场人。编程加办公都有需求的人(Kimi Work 加 Kimi Code 组合)。
不太适合的人:每天 8 小时重度编码的程序员(应该用 Kimi Code 或其他编程工具)。追求对 AI 每一步精细控制的人(Agent Swarm 分工由系统自动调度,黑盒感可能让控制欲强的人不舒服)。只需要聊天问答的人(任何大模型产品都够用,不需要桌面 Agent)。有稳定海外网络和合规账号、且团队深度绑定 OpenAI 生态的人(Codex 在编程场景依然成熟)。
十一、收尾用了一个月 Kimi Work,我的感受是:桌面 Agent 真正的价值不是 AI 更聪明了,而是 AI 终于能跨过聊天窗口直接帮你干活了。
Goal 模式让你定义目标而不是拆解步骤,WebBridge 让 AI 操作真实浏览器而不是搜摘要,定时任务让 AI 主动工作而不是等你指令,300 个 Agent 并行让大批量任务不再是煎熬。这些能力组合在一起,改变的不是某一个功能的体验,而是你跟 AI 协作的方式。在 2026 年的国内环境下,它是我用过的桌面 Agent 中综合能力、可用性和合规性平衡得比较好的选择。免费版可以设 2 个定时任务、体验基础功能,建议先拿一个真实工作任务试试。适合自己再付费,不适合删掉也没损失。
工具是手段,把事情做完做好才是目的。
免责声明:本文为本网站出于传播商业信息之目的进行转载发布,不代表本网站的观点及立场。本文所涉文、图、音视频等资料之一切权力和法律责任归材料提供方所有和承担。本网站对此咨询文字、图片等所有信息的真实性不作任何保证或承诺,亦不构成任何购买、投资等建议,据此操作者风险自担。