WorkBuddy:从会聊天到能干活的桌面智能体

WorkBuddy把AI从聊天框带到桌面任务流里:能读文件、调工具、做计划、交付结果。它适合轻量办公和自动化任务,但复杂工程、财务统计和高精度判断仍需要人工复核。

WorkBuddy桌面智能体

很多人第一次用 AI,是从一个聊天框开始的。

写一段文案,问一个概念,整理一份提纲。AI 给出答案,人再复制到文档里;需要做表格,就粘到 Excel;需要发给同事,再打开飞书、企业微信或邮件。整个过程像是在请一个聪明人给建议,但真正动手的还是自己。

WorkBuddy 代表的另一种方向,是把 AI 放到桌面上,让它直接参与工作。用户不再只问“这件事怎么做”,而是说:“把下载文件夹整理一下”“读完这几份材料,生成一份会议纪要”“每天早上帮我做一份行业日报,并发到指定文档里”。

这时,AI 不只是回答者,更像一个可以被派活的数字员工。

当然,“数字员工”这个词容易说得太满。WorkBuddy 还不能替代专业岗位,也不适合把财务、法律、战略判断这类高风险工作完全交出去。它更准确的定位,是面向办公场景的桌面 AI Agent:能读取用户指定空间里的文件,能调用工具,能拆解任务,能在确认权限后执行动作,并把结果交回来。

它为什么被拿来和 Codex 比?它到底适合哪些场景?哪些地方看起来很强,实际还要小心?这篇文章按产品定位、工作机制、典型场景、与 Codex 的差异、生态策略几个角度拆开说。

WorkBuddy是什么:一个能操作电脑的办公Agent

普通网页 AI 的工作方式,大多停留在“你问,我答”。它可以帮你写邮件、改标题、解释代码,但通常不会主动打开你的文件夹,也不会替你把文件移动到不同目录,更不会把生成的结果放进指定办公软件里。

WorkBuddy 的关键变化,是把“桌面执行能力”放在了核心位置。

它可以读取本地文件,整理文件夹,生成内容,调用办公软件,执行一些自动化流程。用户给出任务后,它不只是生成一段文字,还会尝试理解任务目标,规划步骤,然后在用户允许的范围内操作电脑或连接的工具。

一个很典型的例子是整理下载目录。普通 AI 可以告诉你“建议按文件类型建立文件夹”,但文件还是要你自己拖。WorkBuddy 可以在用户指定的工作空间里扫描文件,根据图片、PDF、PPT、表格、压缩包、安装包等类型进行分类。这件事技术上不神秘,但对办公体验的改变很直接:少了大量复制、粘贴、上传、下载、切换窗口的动作。

这也是它和“ChatGPT 桌面版”的区别。桌面版聊天机器人只是换了入口,WorkBuddy 更强调任务执行。它让用户像给同事分配任务一样描述目标,而不是把每一步都拆成提示词。

对普通办公用户来说,这一点很重要。很多人并不想研究模型参数、命令行环境、插件配置,也不想学习复杂的自动化脚本。他们要的是打开软件、登录账号、指定范围、说清楚任务,然后看到结果。

WorkBuddy 的学习门槛大致可以概括为:

维度 传统网页AI WorkBuddy这类桌面Agent
主要交互 问答、生成文本 派发任务、确认计划、查看交付
文件处理 多数需要手动上传下载 可读取指定工作空间文件
工具调用 依赖插件或外部复制粘贴 可连接办公软件和工具
用户负担 用户负责执行步骤 AI承担部分执行动作
适合人群 熟悉提示词的人更容易用好 普通办公用户也能快速上手

它的价值不是取代 Word、Excel、PPT、飞书、钉钉这些工具,而是把原本散落在多个软件里的步骤包成一个自然语言任务。你不必记住每个按钮在哪,也不必把每个中间结果搬来搬去。

这类产品真正要解决的,不是“AI 会不会说”,而是“AI 能不能接住一件具体的活”。

Ask、Plan、Craft:三种模式对应三种任务风险

WorkBuddy 的任务模式很适合用来理解它的产品逻辑。它通常把任务分成 Ask、Plan、Craft 三类。

这不是简单换几个按钮,而是在区分任务风险。

Ask:只读,不动手

Ask 模式更接近传统问答,但多了一个关键能力:它可以读取用户指定工作空间里的本地内容。

比如你把几份 PDF、Word 文档或表格放进某个文件夹,问它:

帮我看一下这几份材料,提炼出客户最关心的三个问题。

在 Ask 模式下,它主要做阅读、分析、总结,不会主动修改文件,也不会删除或移动内容。适合用来查资料、读文档、做归纳、分析本地内容。

这个模式的好处是风险低。你不确定 AI 能不能理解材料时,可以先让它读,先问,再决定要不要进入下一步。

Plan:先给方案,再执行

Plan 模式适合流程较长、容易返工、需要用户参与决策的任务。

比如你说:“帮我做一个个人网站。”这句话其实很粗。网站用什么技术?包含哪些页面?要不要文章列表?要不要作品集?部署到哪里?风格是简历型还是作品展示型?

如果 AI 直接开干,很容易做偏。Plan 模式会先把任务拆成步骤,给出技术方案、页面结构和执行路径。用户确认后,它再继续生成页面、写内容、部署预览。

这类模式牺牲一点速度,换来更高的可控性。复杂报告、网站开发、流程自动化、跨工具协作,都更适合先 Plan。它像是在让 AI 先写执行方案,而不是一上来就改文件。

Craft:目标明确时直接执行

Craft 模式更像“直接干活”。

整理文件夹、把几张图片做成简单视频、生成固定格式文档、转换文件格式,这些任务目标清楚、风险相对低,不一定需要 AI 先写一份计划。

比如用户给两张图片,让它生成一个带转场的 MP4 视频。这个任务不复杂,交付物也很明确。AI 可以直接调用工具完成处理,然后把成品放到指定位置。

三种模式背后,其实是在解决一个老问题:用户不可能每次都写出完美提示词,也不可能每次都预判 AI 会怎么操作。

所以 WorkBuddy 用模式、工作空间、权限确认来降低风险。AI 只能在用户指定范围内工作;涉及删除、修改、发送、写入等敏感动作时,需要用户授权。这个设计不华丽,但很必要。桌面 Agent 一旦能动电脑,边界就比聊天机器人重要得多。

它能做什么:从文件夹到工作流

WorkBuddy 的使用场景可以分成四类:本地文件处理、内容与多媒体生成、办公协作、自动化任务。

1. 本地文件处理:最容易感知的差异

整理文件是最朴素,也最能体现桌面 Agent 差异的场景。

很多人的下载目录都很乱:合同 PDF、截图、安装包、压缩包、会议录音、表格、PPT 混在一起。过去要整理,通常是按类型筛选、手动拖拽、重命名、建文件夹。AI 聊天框能给建议,但帮不上太多。

WorkBuddy 可以在用户授权的目录里扫描文件,再按类型或规则分类。比如:

任务 传统做法 WorkBuddy做法
整理下载文件夹 手动筛选、拖拽、改名 指定目录后自动分类
查找某类资料 逐个文件夹翻找 读取文件名和内容后汇总
合并会议资料 人工复制到同一目录 按主题收集并整理
清理重复文件 借助工具或手动判断 扫描后给出处理建议

这类任务不需要高深推理,但很耗时间。对普通用户来说,能把这些小活交出去,就是直接的效率提升。

2. 内容与多媒体生成:不只写文字

WorkBuddy 不只处理文本。它可以调用工具处理图片、视频等多模态任务。

比如把两张图片做成带转场效果的 MP4 视频。用户不用打开剪辑软件,不用设置时间轴,不用导出格式。只要说明素材和效果,AI 就能尝试生成成品。

这类能力适合做轻量内容:活动预热视频、简单产品展示、内部培训素材、朋友圈短视频初稿。它不适合替代专业剪辑师,也很难处理高级审美和复杂节奏,但能把“从零开始动手”的门槛降下来。

如果只是想把几张图变成一个能发出去的短片,桌面 Agent 比聊天框更顺手。

3. 网站开发:能做原型,但别当高级工程师

WorkBuddy 可以通过 Plan 模式执行网站开发类任务。用户提出“帮我开发一个个人网站”,它先确认方案,再生成首页、文章页、作品集等页面,最后给出预览或部署结果。

这个能力容易让人兴奋,也需要说清楚边界。

它适合做个人主页、活动页面、简单作品集、内部工具原型。需求越清楚,结果越稳定。比如你告诉它页面栏目、色彩偏好、内容结构、部署方式,它就更容易做出可用版本。

但如果任务变成复杂工程,比如多模块业务系统、权限管理、支付链路、性能优化、长期维护,WorkBuddy 目前不适合完全接管。它可以帮你搭初稿、写样例、改页面、生成文档,却不该在没有工程师复核的情况下直接上线关键系统。

把它当成“能快速搭架子的初级开发助理”,比把它当成“全栈专家”更稳妥。

4. 办公协作:连接工具后,价值会放大

WorkBuddy 的另一个重点,是通过连接器打通办公工具。

它可以连接飞书、钉钉、企业微信、腾讯文档、腾讯会议、网盘等工具。连接之后,任务就不再停留在“生成一段内容”,而可以变成完整流程。

比如:

每天早上整理新能源汽车行业动态,生成一份简报,存入飞书文档,并把链接发到指定群。

这个任务包含搜索、筛选、总结、写入文档、发送通知。过去需要人打开多个工具,来回复制。Agent 的价值就在于把这些动作串起来。

再比如会议场景。它可以读取会议纪要或录音转写,提取待办事项,按负责人拆分,再同步到协作文档。对管理者、运营、市场、行政、人力这类岗位来说,这些工作不难,但频繁、琐碎、容易漏。

5. 自动化定时任务:让AI按时间干活

如果 AI 只能在人发消息后才响应,它还是一个被动工具。WorkBuddy 的自动化任务让它更像一个可以定时执行的助手。

用户可以设置触发时间、任务内容和通知方式。比如:

自动化任务 可能的输出
每天生成 AI 行业日报 文档链接、摘要、重点新闻
每周整理项目进展 周报、风险点、下周计划
每晚生成儿童睡前故事 固定风格的短故事
每月汇总会议纪要 待办清单、负责人、完成情况
定期整理网盘资料 分类目录、重复文件提示

这类任务最适合“固定格式、固定时间、固定数据源”的工作。规则越稳定,AI 越容易做好。反过来,如果任务每次都需要大量临场判断,就不适合完全自动化。

6. 记忆与全局规则:让AI少犯重复错误

WorkBuddy 还可以记录用户偏好,或者通过全局规则约束输出风格。

比如你可以要求它“先说结论,再讲原因”“少写套话”“用技术经理能看懂的方式解释”“所有日报控制在 800 字以内”“表格优先”。

这类设置看起来不起眼,但长期使用时很有用。因为很多 AI 工具的麻烦不在于不会写,而在于每次都要重新提醒它“别啰嗦”“按这个格式来”“不要用营销腔”。

让 AI 记住工作习惯,本身就是办公 Agent 走向日常化的一步。

WorkBuddy和Codex:不是谁淘汰谁

WorkBuddy 经常被拿来和 Codex 比。这个比较有价值,但不能只问“谁更强”。

它们的产品定位不同。WorkBuddy 更接近普通办公用户的桌面 Agent,强调低门槛、快响应、能连国内办公生态。Codex 更偏向代码和复杂工程任务,适合有技术背景的人用来处理开发、调试、项目理解和高难度推理。

一个简单判断是:WorkBuddy 像一个上手快、听指令、能处理大量杂活的初级员工;Codex 更像资深工程助理,适合复杂、精密、需要深度理解的任务。

WorkBuddy强在轻量办公和国内生态

在轻量任务上,WorkBuddy 的优势很明显:启动快,门槛低,不要求用户懂工程环境。有人测试让两个 Agent 根据知识库生成简历,WorkBuddy 约两分钟生成初稿,Codex 耗时更久。这个案例不能说明 WorkBuddy 全面更强,但能说明它在轻量办公任务里的响应体验更顺。

它还有一个现实优势:国内办公生态适配。

中国用户的工作流经常分布在微信、企业微信、飞书、钉钉、腾讯文档、腾讯会议、网盘里。一个 Agent 如果只能在浏览器里回答问题,就很难进入真实工作。WorkBuddy 能连接这些工具,意味着它更容易进入日常办公链路。

开放性也是它被频繁提到的原因。它可以接入第三方模型、技能、连接器和外部信息源。用户在不同任务中切换模型或技能,理论上可以降低成本,也能让不同能力各自发挥作用。

Codex强在复杂代码和深度推理

Codex 的优势集中在复杂代码、深度工程和高难度推理任务。

复杂项目不是写几个页面那么简单。它涉及目录结构、依赖关系、测试、构建、历史代码、边界条件、线上风险。Codex 在多文件理解、代码修改、调试反馈、工程化流程上更有优势。面对精细页面复刻、多模块调度、复杂 bug 排查时,它通常更可靠。

设计类任务和战略性深度判断也不是 WorkBuddy 的强项。尤其是审美、图片质量、复杂信息权衡,这些地方很依赖底层模型能力。WorkBuddy 能把流程跑起来,但结果是否足够好,还要看模型、工具和用户复核。

发票统计案例:复杂信息抽取不能只看“会不会操作”

有一个测试很能说明问题:同样统计 QQ 邮箱里 5 月、6 月、7 月发票总金额,WorkBuddy 识别到 31 张发票,合计 4734.69 元,并提示有大量邮件未识别;Codex 统计出的数量级约为 60 多万元。

这个差距不只是“谁算得快”的问题。

发票统计涉及邮件搜索、附件识别、正文链接跳转、票据信息抽取、金额汇总、重复项判断。很多发票未必直接在附件里,可能藏在邮件正文链接、平台通知或跳转页面中。Agent 能打开网页、能读邮件,不代表它一定能完整理解所有信息路径。

这类任务提醒用户:桌面 Agent 的执行能力很重要,但底层模型的理解能力、网页处理能力、信息抽取能力同样重要。涉及金额、合同、发票、法律文本、客户承诺时,AI 的结果必须复核。它可以做第一轮收集和整理,不能替你承担责任。

生态与商业化:腾讯为什么要做办公入口

WorkBuddy 的想象空间,不只是一个单点效率工具。它更像腾讯在 AI 办公入口上的一次布局。

腾讯手里有大量办公相关产品:微信、QQ、企业微信、腾讯文档、腾讯会议、腾讯云,还有面向开发者和企业的服务。如果这些工具各自独立,用户仍然要在多个窗口之间切换。WorkBuddy 的价值,是把它们重新编排成一个由自然语言驱动的工作系统。

当用户说“整理会议内容并发给项目组”,背后可能涉及腾讯会议、转写文本、腾讯文档、企业微信通知。当用户说“把网盘里的资料按项目归档”,背后涉及网盘、文件识别、目录结构和权限控制。

这就是办公入口的意义:谁能承接用户的自然语言任务,谁就有机会成为下一层工作台。

有第三方访问量统计称,WorkBuddy 上线后 PC 端访问量增长较快,其中 3 月访问量约 885 万,6 月达到约 2097 万;同期字节 TRAE 约 1279 万,阿里 Q2 Work 约 788 万。不同统计口径可能有差异,但趋势本身说明,桌面 Agent 和办公智能体正在进入更多人的试用清单。

还有市场预测称,中国智能体市场规模可能从 2025 年的 804 亿元增长到 2030 年的 6968 亿元,五年复合增长率超过 50%。这类预测不能当成确定结果,但可以说明一件事:资本、平台和企业客户都在寻找“AI 真正进入工作流”的路径。

WorkBuddy 的生态模块也围绕这个目标展开。它内置领域专家、技能和连接器,覆盖数据分析、前端开发、营销策划、办公协同等方向。复杂任务可以由多个专家或 Agent 拆解协作。对用户来说,这比“自己选择模型、自己找插件、自己搭流程”更省事。

商业化上,WorkBuddy 采用积分制,个人版和企业版有不同付费方案,也存在注册赠送积分、签到赠送积分等机制。这个设计很常见:先降低尝试门槛,让用户把工具放进工作流,再逐步让高频用户和企业用户付费。

从腾讯的角度看,逻辑大致有三层:

战略目标 WorkBuddy承担的角色
降低迁移成本 连接现有办公工具,让用户不用换工作习惯
获取真实任务数据 通过办公任务改进Agent系统和工具链
抢占AI办公入口 把自然语言任务变成新的工作入口

这里需要克制一点。访问量、价格、企业采购、模型提升等信息,很多来自公开讨论和视频转述,不宜直接当成官方完整确认的结论。更稳妥的判断是:WorkBuddy 的方向很清楚,腾讯希望它不只是一个 AI 工具,而是连接办公生态的入口。

适合谁用,不适合谁完全托付

WorkBuddy 最适合的用户,不一定是技术人。恰恰相反,它更适合那些每天被大量事务性工作包围的人。

比如运营要整理活动数据、写周报、做竞品动态;市场要生成内容初稿、整理素材、产出简报;行政和人力要处理文档、会议、通知;管理者要看项目进展、提取风险点、安排跟进事项。对这些人来说,最痛苦的不是不会做,而是重复动作太多。

WorkBuddy 能帮上忙的场景包括:

  • 整理本地文件和网盘资料
  • 阅读文档并生成摘要
  • 写日报、周报、会议纪要
  • 制作简单图片、视频、PPT 初稿
  • 连接飞书、钉钉、企业微信、腾讯文档等工具
  • 设置固定时间运行的自动化任务
  • 快速搭建个人网站或业务原型
  • 根据固定规则生成标准化内容

它不适合完全托付的场景也很明确:

  • 复杂大型代码工程
  • 对审美要求很高的品牌设计
  • 战略决策和商业判断
  • 财务、法律、合同等高责任任务
  • 需要完整追溯来源和严格准确性的统计
  • 涉及隐私、权限、客户数据的敏感操作

最稳妥的用法,是把 WorkBuddy 当作初级 AI 员工来管理。你要给清楚目标,选对模式,限定工作空间,检查关键结果。

如果只是读资料,用 Ask。
如果任务复杂,用 Plan。
如果目标明确、风险低,用 Craft。

不要把“能执行”误解成“能负责”。它可以帮你省掉许多机械动作,也可以把一些任务做到七八十分,但最后的判断、取舍和责任仍在人这里。

从问AI到管AI

WorkBuddy 的价值,不在于证明它全面超过 Codex,也不在于把所有办公软件都替掉。它真正降低的,是“让 AI 真正干活”的门槛。

过去使用 AI,很多人停在聊天框里:问一句,拿一段答案,再自己处理后续步骤。WorkBuddy 把这条链路往前推了一步。用户开始给 AI 分派任务,要求它读文件、做计划、调工具、生成交付物,再由人检查结果。

这会改变人和 AI 的协作方式。

以前是“我问 AI”。
现在更像“我管 AI”。

这个变化不需要说得很玄。它发生在很具体的动作里:下载目录被整理好,会议纪要自动生成,日报按时写进文档,几张图片变成视频,一个个人网站有了初版。每件事都不惊天动地,但它们加起来,就是办公软件从“工具箱”变成“可调度工作流”的开始。

WorkBuddy 还不是万能专家。它更像一个愿意干活、上手快、需要检查的助手。用得好,它能接走许多琐碎任务;用得太放心,它也会在复杂信息抽取、金额统计、审美判断和工程细节里出错。

把它放在合适的位置,它的价值就很清楚:不是替你做所有决定,而是让更多人第一次体验到,把任务交给 AI 执行到底是什么感觉。