

刚开始用AI做产品那阵,我没少吃过这种亏:一个本来跑得好好的功能,让它改个小地方,它顺手把别的搞崩了,我还找不回来。
后来才学乖,老老实实用git管版本。2024年9月,我在《Cursor十大技巧》里就专门写过:「用Git做版本管理,在关键成功节点提交时写好说明,给自己复原的机会。」再后来做fanbox(我那个coding agent的驾驶舱),我还特意加了「回合存档」,改崩了能退回去。
我自己是出新手村了,但现在还是会经常看到新手栽在这个坑里。尤其是最近work类agent开始兴起,更多原本缺乏技术背景的白领开始用agent工作之后,我更是经常刷到这种PPT或者文档被AI越改越坏的吐槽

他们不写代码,让agent去动电脑上的Word、PPT、攒了几年的素材文件夹,也需要有个能退回去的办法。
以及,偶尔还能看到更惨的案例。2个月前,AI投资人Matt在X上还有个传播甚广的吐槽,说agent意外删掉了他Mac上几乎全部文件😂。以rm的方式删除,确实基本等于文件全都完蛋了,挺恐怖的。

也是这阵子,我偶然刷到两份讲agent安全的第三方报告,一份IDC的,一份Omdia的。
IDC那份挺有意思,它让一批产品用同一个模型(DeepSeek-v4 Pro)去跑近百道真实办公任务。同一个模型,结果得分还是拉开了明显差距。IDC给的结论是:「Harness工程能力直接影响任务表现。」在它那套九个维度的评估里,WorkBuddy综合得分第一,7.30分(满分10),6项拿了满分。

「Harness决定表现」这个判断,倒是和我自己的体感挺像的。现在很多开源模型都是公共品,谁都能用,模型之上那层工程(Harness),才是真正拉开差距的地方。而安全,恰恰是这层工程里最要命的一环:一个agent能不能托付,除了看能力之外,也很需要你敢放心把权限丢给他,不担心出问题。
另一份Omdia也是类似的落点,它在可托付任务效能、执行工程韧性、企业级管控这几个维度上,给WorkBuddy的分都显著高于它统计的市场平均水平(均值2.7到3.3,WorkBuddy都在4.5以上)。

报告归报告,分数再高我也得自己上手才信。我发现我发很多开源项目的时候,粉丝都挺关注WorkBuddy能不能用的,最近从几个平台看到WorkBuddy好像也确实是目前月活用户量最大的work类产品。所以我干脆带着一个具体的问题去测了测:
一个给不写代码的人用的桌面agent,它是怎么给用户提供安全和掌控感的?
我平时用各类agent最烦的一个功能之一是他们老是弹各种确认提醒,所以我基本都会给agent几乎全部的权限,让它别没完没了的确认了。

这是WorkBuddy开启「完全访问」前的授权提示,后面的删文件测试是在默认权限下做的。
但是呢,我觉得他们还是该有个基础的把控机制,别让不可逆的大问题发生。所以我试了一把看WorkBuddy面对危险操作环境的时候,是怎么处理的。
我先造了60个文件,让它删掉其中55个,留5个。这是那种最容易出事的活——批量删除,你根本不会一个个去看它到底删了啥。
结果它没直接动手。它先自己数了一遍,确认「文件夹里有60个文件」,然后停下来,弹了个框。

它先提醒这次删除可能导致不可逆的数据丢失,再把要删的55个、要留的5个列出来给我看。它还自己补了句:我会先做一份备份再移入废纸篓,而不是直接删除,误删还能从废纸篓恢复。

我点了确认。但删完我没信它,自己去查了三样:
文件是不是真删了、是真进废纸篓了、还是偷偷rm掉了。我打开废纸篓,55个都在,时间戳对得上。它说的那份备份靠不靠谱。我把备份挨个算了一遍sha256,跟删之前一模一样,55个一个不差。

这几步下来我才敢说:它删东西默认是往废纸篓里挪,rm不掉,还顺手留了份字节不差的原件。这个,就是我一直在找的那个撤销键。
改文件也一样。我让它改一份讲稿,它动手前一刻,自动把原件存了一份——我查过,那份备份跟改之前逐字节一致。它这些能力是拧成一个「安全中心」的,删除、备份、沙箱、审计都在里头,默认就开着。

我翻了翻它的日志
其实上面的测试有点刻意,可能这么主动明确有风险的事,WorkBuddy是有个固定机制知道该怎么处理。于是我又让agent查了查它在我电脑上留的记录,挖到三个我觉得更实在的东西。
第一,它其实早就拦过我一次。8月29号凌晨,我在做一个发布片,让它清渲染的临时帧,命令是批量rm。它数出来要删53个,超过了它设的50个阈值,就停下来等我点头。那天要不是它拦一下,我可能真就没细看。
第二,它记的那个操作日志,是条哈希链。每条记录都带着上一条的指纹。我验了那天的214条,213处首尾全对得上,一处没断。意思是它做过什么,你想偷偷抹掉一条而不被发现,是做不到的。

第三,安装技能也有一道检查。我打开它的导入技能窗口,里面有个「非高风险自动安装」的选项。对于经常到处找skill来用的人,这个提醒挺有必要的。以及,你也可以理解为万一有高风险的skill,WorkBuddy会帮你兜个底。
这些保护措施,让我更愿意把文件交给它。但真拿来干活,任务成不成,还挺依赖选哪个模型、需求说得够不够具体。资料能不能读到,合适的工具和skill能不能用上,也一样重要。所以我挺在意,WorkBuddy在这些事情上给了我多少选择。
先说模型。国内的开源模型这一年一直在你追我赶,今天这个SOTA明天那个SOTA,变得飞快。WorkBuddy的做法是,你在它上面始终能用到最新的那批,十几个模型随便切,统一按积分算钱,也可以接自己的API。

我觉得难得的地方在这:早些年腾讯自家模型弱的时候,它开放我还能理解,反正自家的不够强。但现在它自己的hy4 preview,已经基本达到一线开源模型的水平了,还愿意维持这种「你想用谁用谁」的状态——这个就不太一样了。自家孩子还没长大时开门,和自家孩子长成了还继续开门,完全是两回事。
再说另一层开放,是上下文。大家现在都知道,一个agent好不好用,核心看它能不能够着你真实的工作上下文。能不能读你最近写的文档,能不能直接在你的活儿里把东西输出出来。这事我做fanbox的时候体会很深,agent聪不聪明是一回事,够不够得着你手头的料是另一回事,后者常常更要命。
WorkBuddy除了自家的腾讯文档,还能直接连飞书、钉钉这些。连竞品家的办公产品都往里接,这心态是真开放。

还有件事让我挺意外。我自己开源的那个女娲skill,搜了一下,已经被内置进它的技能市场、摆在推荐位里了。一个独立开发者的开源东西,直接进了腾讯产品的默认列表,这种双向的开放,比它自己说一百句都实在。你开门让别人进来,也得别人愿意把东西摆进你家,这才叫生态。反正我自己觉得挺荣幸的,欢迎大家多用
绕回开头说的git。
虽然我的人设一直是不会写代码,但是也能通过vibe coding做出各种成果的先行者。但天知道🤷我在2年前刚开始Vibe Coding的时候踩了多少坑,才逐渐积累经验淌过来的。
那时候我让大家自己去commit、自己留退路,是因为那会儿没人替你兜底。现在这件事被做进了WorkBuddy产品里。
也就是说一个不写代码的人,终于也能相对没有顾忌地自由尝试和迭代自己的想法,少碰点壁了。而我真的知道,之前被踩坑把项目毁坏的体验有多糟糕,让多少人试着试着就从入门到放弃了。
安全能力看着是给agent加了一道道限制,其实是给用它的人,加了点胆子。
编辑补充:如果你也想把 WorkBuddy 真正用进自己的日常工作,我们最近正好把相关的实操方法整理进了课程里。以下是优设课堂的课程信息,感兴趣可以继续看看。
课程链接:https://lzov3.xetslk.com/s/30ABct

复制本文链接 文章为作者独立观点不代表优设网立场,未经允许不得转载。









发评论!每天赢奖品
点击 登录 后,在评论区留言,系统会随机派送奖品
2012年成立至今,是国内备受欢迎的设计师平台,提供奖品赞助 联系我们
用户体验增长
已累计诞生 795 位幸运星
发表评论
↓ 下方为您推荐了一些精彩有趣的文章热评 ↓