2026年AI工作助手横评:WorkBuddy vs Kimi Work vs 百度搭子,谁才是效率之王?
近期,ChatGPT与Codex的正式融合释放了一个明确信号:这一轮AI的聊天范式正逐渐退潮,行业焦点全面转向工作场景,连编程领域也不例外。
市面上各类Work类产品层出不穷,从Codex、Claude Cowork,到Workbuddy、Kimi Work、百度搭子,再到TRAE Work、Qoder Work、豆包专业版、QClaw、Marvis等Agent,令人眼花缭乱。它们陆续住进用户的电脑和手机,多端联动、远程协同,声称能真正替人干活。
这些Agent干活的质量、效率与成本究竟如何?本次我们选取了三款代表性产品——WorkBuddy、Kimi Work和百度搭子,进行一场全面横评。


Agent横测
统一规则:同一任务、相同素材、一致交付标准,每个Agent仅一次执行机会,最终从质量、效率和成本三个维度对比(成本在最后统一说明)。
1)Office任务
先从简单的Office场景开始,让三位Agent各完成一次联网搜索 + 文档生成任务。
提示词:联网检索2026年6月中国新能源汽车的销量情况,帮我出一份市场调研报告(word)和一份Excel市场统计表格。你的输出尽量言简意赅(报告控制在1500字以内),不要太多废话和无关分析。
速度方面,WorkBuddy最先完成,后两者还在调命令、启动工具;第二个抵达终点的是百度搭子,最后是Kimi Work。

速度快不等于质量高,我们直接看交付物。
WorkBuddy:



总体数据方向正确,但细节经不起推敲——比亚迪的批发数据存在错误,热门车型统计也不准确。更关键的是,它没能理解提示词中“销量”的具体含义。销量一般主要看批发(厂家卖给4S店),涵盖国内和出口;零售则是4S店卖给消费者。WorkBuddy将批发与零售混在一起,导致统计口径不一致,误差较大。
Kimi Work:

(Kimi报告,上下滑动查看全图)

所有数据完全准确,它明确理解我们要的是“销量”,而非批发或零售口径。Word和Excel的排版审美也在线。不过仍有一个瑕疵——Excel中的图表丢失了,大概率是Python代码在Windows环境下的适配问题。
百度搭子:

(调研报告,上下滑动查看全图)

数据全部精准,同样只统计销量,没有混入零售。更让人惊喜的是,它还自动生成了报告封面和页眉。

生成的Excel表格也自带审美,不是“毛坯房”,可以直接拿来用。
这轮实测中,Kimi Work和百度搭子均表现可靠——数据准确,Word与Excel具备排版和美感,能直接交付。本轮结论:百度搭子 ≈ Kimi Work > WorkBuddy。
2)视觉任务
视觉理解是办公中的高频刚需场景,要求Agent能准确解读用户五花八门的上下文素材,才能真正进入实际工作流。
此前我开发了一款名为“Markdown编辑器”的产品,评论区直接爆了,涌入了200多条留言。光是整理这些开发建议,人工梳理恐怕就要耗费数小时。

于是,我把一个极长的留言截图丢给三个Agent。
提示词:我开发了一款产品叫「Markdown编辑器」,“图1.png”是用户的留言情况,有很多用户给出了开发建议。帮我统计大家提的开发建议,整理成产品需求文档给我。
照例,WorkBuddy率先完成,Kimi Work第二,百度搭子最后。

来看结果。
WorkBuddy:
表现中规中矩,大致理解了留言内容,但挖掘得不够深。真实开发中,我绝不会把这样一份产品需求文档(PRD)直接交给AI。

Kimi Work:

这份PRD相当靠谱,它按提及热度与业务价值将需求分成三个优先级,并给出了具体的技术路径。真实用户的留言表达极不规范,口语、单词、不完整语句甚至错字比比皆是,AI需要从中提炼真实意图,对模型的推理能力要求很高。这项任务上,Kimi Work明显强于WorkBuddy。
百度搭子:

(PRD,上下滑动查看全图)
同样,百度搭子也划分了三个优先级,每个优先级都配有详细需求列表。稍作修改,就能直接交给AI继续进行二次开发。
本轮实测:Kimi Work > 百度搭子 > WorkBuddy。
3)Skill任务
Skill的重要性不言而喻。下面让三位Agent调用同一个信息图Skill,总结近期OpenAI发布的GPT‑Live,生成一份HTML形式的信息图。
提示词:调用html-infographic-generator skill,总结GPT‑Live(产品链接:https://openai.com/zh-Hans-CN/index/introducing-gpt-live/),页面高级审美,文字言简意赅。
这次Kimi Work率先完成,百度搭子和WorkBuddy几乎同时结束。
WorkBuddy:

整体还说得过去,但大标题与小字的配合还需打磨,视觉层次感也稍弱。
Kimi Work:

Kimi的前端审美依然在线,不过它把这次任务做成了网页风格,有明显的模块分区,而非我所要的信息图。
百度搭子:

审美同样在线,大标+小字+数字的布局清晰,并用青色高亮加以区分,让关键内容更醒目。百度搭子和WorkBuddy对Skill的执行更加严谨,就产出物的整体美观度而言,百度搭子更胜一筹。
本轮实测:百度搭子 > WorkBuddy > Kimi Work。
4)新媒体任务
最后一项是我个人最关心的新媒体任务,看看现在的Agent能在内容创作上帮我走到哪一步。提示词略微复杂,考验它们能否一次跑通。
提示词:
我是一名AI自媒体博主,主要擅长将AI技术掰开了、揉碎了讲给大家听。
现在,请帮我梳理2026年7月都有哪些新模型发布,海内外都要有。然后帮我写一个“7月大模型总结”的选题内容,公众号文章、小红书图文和视频脚本都要有,内容适配各平台的调性。
整体内容既有技术深度又能让人看懂,不枯燥,让人看了就想一键三连,具备爆款潜力。
WorkBuddy依然率先完成,因为它交付的全是markdown文件,所以很快。

Kimi Work一度提示“聊天的人太多”,可能因为我的会员刚好到期,重新充值后才继续工作。

百度搭子第二个完成。直接测试时,速度和质量与大家接近;但启用了「自媒体套件」后,质量直接起飞。

它会先进行一系列问题澄清,列出多个内容方向,由我选择后再进行生成。

下面看具体交付。
WorkBuddy:

(WorkBuddy公众号,上下滑动查看全图)

(WorkBuddy小红书,上下滑动查看全图)

(WorkBuddy视频脚本,上下滑动查看全图)
此前说过Hy3的写作能力还不错。在这项任务里,它写的公众号文章、小红书文案和视频脚本确实很接地气,让人读得进去。但遗憾的是,它整理的7月大模型事实清单有一半是错的,幻觉严重。

外行粗看可能觉得“有模有样”,但内行一看全是漏洞,后期改起来非常麻烦。
Kimi Work:

(Kimi Work公众号,上下滑动查看全图)

(Kimi Work小红书,上下滑动查看全图)

(Kimi Work视频脚本,上下滑动查看全图)
7月模型盘点整体准确,但夹杂了一些小众模型(如盘古、零一万物、Meta),且遗漏了Grok 4.5。小红书的稿子写得不错,公众号和视频脚本则略显平庸。
百度搭子:

(公众号文章,上下滑动查看全图)

(小红书文章,上下滑动查看全图)

(视频脚本,上下滑动查看全图)
7月模型盘点完全准确,是三个Agent中最精准的,且只梳理热门模型,没有拉入小众产品。视频脚本同样出色,列出了具体的口播稿、分镜表、标题和字幕文案,连发布平台的文案都已就位。

本轮实测:百度搭子 > Kimi Work > WorkBuddy。

写在最后
最后,从效率、质量、成本三个维度做一个总结。
效率: WorkBuddy最快,四个任务基本都是第一个完成。百度搭子和Kimi Work紧随其后,大约晚1~3分钟。
成本: WorkBuddy最近Hy3免费两周,积分消耗为0;Kimi Work四个任务消耗了Allegretto订阅的2%,换算下来约4块钱;百度搭子新用户赠送1000积分,四个任务消耗400多积分,不花钱。如果按最基础的Pro订阅(¥9.9/25000积分)来算,仅不到2毛钱。
质量: 四轮任务里,百度搭子和Kimi Work表现最佳,不相上下;WorkBuddy垫底。
综合来看,如果给这三个Agent打星推荐:百度搭子五星,Kimi Work四星,WorkBuddy三星。

欢迎在评论区分享你的体验:这期横评与你个人的感受一致吗?你日常最常用的Agent是哪一款?为什么选择它?