

新模型刚发布那几天最聪明,过一阵就开始降智,这事估计不少人都有体感。
这个9月又赶上一轮。月初OpenAI发了GPT-6 Astra,现在又刚上了Sol和Luna。我这边额度马上就要刷新,还剩很多没用,赶上国庆,又连着给了2张重置卡,得提前想想怎么最大化利用好它,不错过智商黄金期。

模型正聪明,额度也多,假期时间又长,这几样难得凑到一起。我是平时有额度的时候忙得没空用,有空的时候额度又不够,好多想干的事就这么拖着,比如我很早就想用AI把这些年写过的东西全部整理一遍,搭一个自己的知识库,到现在都没动手。
到底拿这几天干点什么,才不算浪费?我还专门去研究了一下,就有了今天这篇分享。
先说降智。我的感觉是,模型刚发布厉害得不行,各种算力往上堆,发布没几天,算力是不是就偷偷挪去训练下一代了,我没证据,但体感就是这样。
网上的猜测就更多了。有人说是为了省成本,用的人一多,就悄悄换成压缩过的版本,或者把思考时间调短。也有人说是上线后不停打补丁,限制越加越多。就有点像大家吐槽新开的饭店,开业头一个月大厨亲自掌勺,等排队的人一多,菜就开始缩水了。
今年1月,程序员扎堆的论坛Hacker News上有个帖子挺火,有人专门做了个追踪页面,每天给Claude Code跑一遍基准测试,就为了看它有没有降智。结果发现,确实是降了,那帖子火了以后,Claude Code团队的人跑到底下回复,说1月26日工具层面引入了一个问题,28日一发现就回滚了。

网址:https://news.ycombinator.com/item?id=46810282
还有网友吐槽Codex,说每次新模型一发布,额度重置一发,能热闹个两三个星期,然后又回到从前。
到底是哪种原因,咱们很难说清。但对我们普通用户来说,能抓住的就一件事,新模型刚上线那两三周,至少体感上是它状态最好的时候,算是一个窗口期。
这段时间怎么花,我觉得就看一条,额度用光以后,能留下什么。比如一份以后还能接着用的skill,一份整理好的作品集,这些都挺划算。
按这个标准,我是这样排的。前三件是新模型窗口期专属,先拿自己的活测它看实力,再把以前做不成的难题拿出来试一次,然后趁它聪明,把skill提炼好、重写一遍。后两件留给多出来的额度,把卡在半路的项目推到能用,再去干平时舍不得开的大活。
额度多的情况下,第一反应肯定是把思考强度拉到Ultra,但我不建议每件事都拉满。不只是考虑强度、额度,还得看时间,有些屁大点事如果都开Ultra真的很浪费时间,主要太慢了。

如果把Ultra打开,它会主动分拆多个agent一起干活,花的时间比其他档位多。活多、能拆开的任务,比如一口气读几十份材料,开它就比较合适。如果每一步都要等你看效果的活,拆分的agent帮不上忙,额度倒是照样掉得飞快,难怪有网友说,大部分时候开Ultra都是杀鸡用牛刀。
所以下面每件事,我都标了开到哪一档,各家档位的名字不太一样,按高低对应着选就行。操作顺序都一样,每件事单独开一个新对话,模型选最新的,调好思考强度,再把提示词和材料一起发过去。
新模型上线,最快的测试方式,就是你把之前用旧模型做过的任务。材料跟要求都是现成的,你也知道好结果是什么样的,当时哪里不满意的地方也记得,同样的材料让新模型重跑一遍,有没有提升,一眼就能看出来。
我要用一个之前做过的任务来测你。 材料和要求在[文件],当时的结果在[文件],我对它的评价是[一句话,例如:结构对,但配色和字号都要我手动改]。 用同样的材料和要求重做一遍,做的过程中不要看当时的结果。 做完再打开当时的结果,逐项对比,哪里更好、哪里更差、哪里一样,附具体位置。 最后一句话告诉我,这个任务你现在能不能独立接过去。
思考强度跟你当时做这个活时保持一致,不然比出来的差距,可能只是档位不同。
这是我觉得窗口期里最该干的一件。旧模型做的不好的活,把当时的输入、要求和结果留好,我一般把提示词存在本地,新模型一出就第一时间发过去,说不定就搞定了。
等过一阵它降智了,同样的活说不定又做不成了,赶在它状态最好的时候做成一次,做出来的东西就是你的了。提示词可以用下面这个
这是我之前没做成的一个任务,材料和要求在[文件],当时的结果在[文件],卡在[一句话]。 先说说你判断当时卡在哪,这次打算怎么做,说完直接开始,不用等我确认。 一直做到[完成标准]再停,中途遇到问题自己排查,只有要删文件或者要花钱的时候才停下来问我。 做完对照原始要求逐条检查,告诉我哪些做到了、哪些还没有。
这个就直接开Ultra,难题的话往往能拆成好几块,正好让它分头去试。OpenAI在9月11日发的Astra使用文章里还提醒过,新模型有时候做完第一版就回来找你确认,所以提示词里要写清楚做到什么程度才算完。

网址:https://learn.chatgpt.com/blog/rethinking-skills-and-prompts-for-gpt-6-astra
这是我平时干得最多的事。skill这个词我其实也写过好多篇文章了(有需要的可以看底部的AI系列文章链接),它不难,你可以把它理解成一份写给AI的工作说明书,以后遇到同类的活,它先看说明书再动手,不用你每次从头说。我自己的写作skill,还有整理语音日记、找选题这几个最常用的,都是这么一点点攒出来的。

我现在用的最多的3个skill,都是我自己手搓出来的。

还没有skill的,先提炼一个。如果你发现,有些任务你需要经常按固定的要求去给AI做限定,那就很适合写成skill了。
像我的语音skill就是这么提炼出来的,因为我基本上每天都在用,然后每天都要它帮我识别语音中逻辑不顺的地方,重复的地方做优化,搞成skill后就不用每次都说了。

已经有skill的,新模型来了值得重写一遍。为了让旧模型听话,我们可能攒了不少规则,每次先读一堆文档,每一步都重复检查。
这是我在[旧模型]上一直在用的[skill名],[粘贴或文件]。 请逐条过一遍,把每条规则分成三类,我的真实偏好、当时为了绕开旧模型毛病加的补丁、现在已经说不清为什么存在的。 后两类,用[保留的新案例]分别试一次,看去掉之后结果会不会变差。 再看看你这一版新增的能力里,有没有能加进这个流程的。 给我一个精简版,标出删了哪些、加了哪些、为什么。 拿不准的先留着,试过再删。
OpenAI那篇文章里就专门建议重新审视skill、AGENTS.md和任务提示词,说过长或互相冲突的说明会增加负担,过去有用的细密步骤,也可能限制新模型发挥。

这个事开High就够了,它要做的是读一份记录、改一份文件,拆子agent的意义不大。skill如果很多、想一次全过一遍的时候,再开Ultra让它同时处理。
不管是新提炼的还是重写的,都要拿一个新任务试。只给它skill和材料,看第一版你要纠正几次,纠正的地方再补进去,第一版通常不太好用,多补几轮就顺手了。具体方法,如果有问题也可以看我之前的教程。
有个小技巧,把新模型这几天做得最好的几份结果存下来当样板。过一阵觉得它状态不对了,把样板一起发过去,让它照这个水准来,通常比空口让它认真点管用。
这件做完马上就能用上。挑一个节后肯定要用、但现在还差几步的东西,可能是作品集里缺了过程说明的项目,可能是一份做到一半的方案PPT,也可能是一份很久没更新的简历。
这种任务最麻烦的地方是把现状跟AI说清楚。我会把它当成交接给一个新同事,讲清三件事,东西在哪,做到哪了,卡在哪。
我要在[日期]交[交付物],给[谁]用。 材料都在[文件夹或链接],以[文件名]为准,其他的只是参考。 已经做完的是[列出来],这些不要动。 现在卡在[具体问题],我试过[做法],结果是[结果]。 接下来只需要做[下一步],做到[完成标准]就算完。 动手前先用三句话复述你理解的现状,我确认了再开始。 做完自己检查一遍,交付文件、检查记录和还没解决的问题。 另外写一份进度说明,记录做到哪了、下一步是什么,我下次续接直接把它发给你。
思考强度开High就行,先打开项目文件夹再发提示词。材料特别多、或者明天就要交的,再上Ultra。
那句复述现状最省额度,它复述错了,说明你没交代清楚,这时候纠正只花几句话。进度说明也别省,下次续接直接发过去,不用从头交代。
做完再单独花一轮让它检查,直接写“检查每一页,列出所有文字、数据不一致和格式错误,附具体位置”。Claude Code的作者Boris Cherny分享工作方式时,也把让Claude验证结果列为重点,他的做法是改完代码直接开浏览器测,看到真实结果再决定下一步。

我说的是那种要来回很多轮、每轮都要看效果再改,或者一次要读几十上百页材料的活。平时不敢开,临期额度正好给它们用,反正不用也是清零。
一时想不起来有啥想干的,先花一轮额度让AI帮你盘点,开Medium就够,比如你可以发给它下面这段提示词,如果你平时有记录的习惯的话,这个盘点会很有用。我就是每天都在写作打卡的,所以对我来说就很受用。
我国庆有[几天]空闲,AI额度也很充足。 下面是我的写作日记里一直想做但没做成的事[粘贴]。 帮我挑出最适合交给AI、而且做完能留下东西的三件,按优先级排好。 每件写清楚要我准备什么材料、做到什么程度就算完。
我就很想试试让AI在Blender里建模,前提是用开源的Blender MCP把AI和Blender连起来,装法我去年写过,后面会贴。
用Blender做一个[物体,例如:北欧风格的木质餐椅],用途是[例如:放进作品集的场景渲染]。 照着参考图[图片或文件,没有就删掉这句]来做,比例和结构以参考图为准。 先用基础几何体搭大形,把比例调对,停下来让我看,我确认了再加细节。 之后每一轮只改我指出的地方,不要顺手重做已经确认的部分。 材质用[例如:浅色木纹],最后输出[例如:正面渲染图和.blend文件]。

我拿这个宜家凳子试了一下。

前后花了26分钟,用掉了22%的周额度,还是挺费额度的。

这是Blender里建出来的效果,基本还原得七七八八了。

全程没有介入,连渲染都是我用codex让blender渲染出来的效果图直出。

去年3月Blender MCP刚开源的时候,我写过一篇最新开源!真的可以用AI 在blender里建模!。当时周末玩了一整天,结论是只能做些简单的模型和场景,说实话挺挫的。一年半过去,还原一个宜家凳子已经像模像样了,这进化速度是真快。
还可以做一个自己喜欢的小游戏。
做一个能在浏览器里玩的小游戏,[核心玩法一句话,例如:躲开从上面掉下来的方块,撑得越久分越高]。 只用一个HTML文件,不依赖外部资源,双击就能打开。 先做最简版本,能玩、有计分、能重开,我试玩之后再加[音效、关卡、难度递增]。 每次改完,告诉我你测试了哪些操作、结果是什么,方便我核对。
初版只花了6分钟,用了1%的周额度

接着又优化了一轮,也是6分钟,2%。

一次修改还好,但游戏改起来没完没了,效果差一点就想调,十几轮下来也是不小的额度。
建模和做游戏这种要你一轮轮看效果的活,思考强度开High就够了,第一版实在不满意再上Ultra,后面的小改降到Medium,改得快也省额度。
国庆要回老家的朋友,还有一件事特别适合趁这几天做。把爸妈这几年的体检报告或者病例啥的都翻出来拍下来,一起发给AI。平时我们都是一份一份看,很少把几年的放在一起对比看身体趋势变化。这件事我打算国庆回家就弄,健康比啥都重要。
这是我[爸爸/妈妈]从[年份]到[年份]的体检报告,一共[数量]份,照片在[文件夹]。 请全部读完,不要抽样。照片看不清的地方直接告诉我,不要猜。 把每年都有的指标整理成一张对比表,标出哪些在持续变差、哪些今年第一次超出范围。 每一条都注明来自哪一年、第几页,我要能查。 最后用爸妈听得懂的话,整理出下次看医生时最值得问的三个问题。
这种一次读一大堆材料的活,最适合开Ultra,让它分头去读,再汇总到一起。发之前记得把姓名、身份证号打上码。它毕竟不是医生,这份整理主要是让你心里有数,看医生时带着问。家里的保险合同也可以这么弄,让它列清楚保了谁、保什么、哪些情况不赔。
这类大活开工前,先拿个小的试试水,看一轮大概吃多少额度,再定一条做到这就停的线,能看、能玩、能查就可以了。
如果你的额度只剩一两天就要刷新,我会挑一个近期要交付的任务,再挑一个最实用的,比如提炼skill,每项都写清输出位置和停止条件。重置前留出验收时间,把文件、进度说明和skill都存好,没做完的下次也能接上。
能在后台自己跑的长任务,出门前布置下去,回来再验收,人出去玩,AI在家干活。
也不用非要把数字薅到0。
说实话,额度这东西挺折磨人的。用的时候看它哗哗往下掉,心疼。快清零了还剩一大截,也心疼。
可只要花出去的额度换回了东西,就不亏。一个拖了很久的任务终于做完,一份以后还会用的skill终于跑通,一个平时舍不得开的大活终于爽了一把,剩下一点额度也没什么可惜的。
我自己这个国庆,打算把惦记了很久的知识库搭起来,回家的时候,再把爸妈这几年的体检报告对一遍。
你呢,有没有哪件一直说着以后再弄的事?
模型会降智,额度会清零,假期也会过完,但能把东西做出来,才会真正成自己的。
复制本文链接 文章为作者独立观点不代表优设网立场,未经允许不得转载。








发评论!每天赢奖品
点击 登录 后,在评论区留言,系统会随机派送奖品
2012年成立至今,是国内备受欢迎的设计师平台,提供奖品赞助 联系我们
用户体验增长
已累计诞生 795 位幸运星
发表评论
↓ 下方为您推荐了一些精彩有趣的文章热评 ↓