2026去AI味终极指南:4组GitHub Skill+三步法,让文案彻底‘说人话’
做自媒体完全绕开AI已不现实,效率暴涨的背后,却带来一个共同痛点——满屏的AI腔。被生硬的机械感折磨?这期为你深度梳理了4套可从GitHub直接获取的去AI味Skill,覆盖写稿、改稿、自查各个环节。如果你也正为AI味头疼,别犹豫,立刻收藏!
去味三步法
- 先自查:不确定哪些句子“一眼AI”?先用检测类Skill定位问题。
- 再改写:把那些生硬、别扭的表达统统翻新成自然的人话。
- 最后补文风:去AI味的终点不是“不像AI”,而是让每个字都带着你独特的表达印记。
这套方法尤其适合搭建长期写作系统:蒸馏表达风格、固化写作规则、注入观点与细节。无论你常写小红书、公众号还是短视频脚本,这份清单都值得放进收藏夹。
01
AI味自查Skill TOP10
先揪出那些“一眼AI”的句子,精准定位再下手修改。

02
去味改写Skill TOP10
把AI腔碾碎重铸,字字都像人亲手敲出来的。

03
个人文风强化Skill TOP10
写出只属于你的味道,从这一刻起搭建长效写作体系。

04
高频Skill速查
下面这些Skill在多份榜单中反复出现,建议优先加入工具箱:
| Skill | 出现次数 | 定位 |
| humanizer | 4次 | 综合去味 |
| Humanizer-zh | 4次 | 中文去味 |
| stop-slop | 3次 | 去AI腔 |
| shuorenhua | 3次 | 说人话改写 |
| taste-skill | 2次 | 审美调优 |
| writing-agent | 2次 | 写作系统 |
| WRITING.md | 2次 | 自审规则 |
| nuwa-skill | 2次 | 文风蒸馏 |
| chatgpt-comparison-detection | 2次 | 检测 |
05
如何快速上手?
大部分中文Skill都能在WorkBuddy的内置市场里直接搜索安装:

WorkBuddy同时也打通了SkillHub市场的资源搜索!如果没找到,还可以去下面三个市场碰碰运气:
· clawhub.ai
· skills.sh
· github.com
最后记住:真正的去味从来不是一个Skill单打独斗,而是在持续创作中沉淀、组合、迭代,直到打磨出完全适配你个人文风的AI内容搭档。
4K显示器选购避坑实录:哪些情况真的需要升级高分屏?
电脑能否带动4K是关键前提:如果你的设备性能不足,普通电脑强行上4K屏只会适得其反。
不妨先用家里的4K电视接上电脑测试——如果连电视都带不动,分辨率会无法达到标称值,鼠标拖拽也会严重卡顿。
我2018年入手过一台43寸的4K显示器,当时高分辨率面板昂贵,刷新率只有30Hz。接到电脑上使用时,过大的尺寸让日常办公变得异常吃力,眼睛酸胀不适。几年下来屏幕老化显著,局部出现过曝亮点,看起来就像一个个光斑,完全不适合再做显示器,现在只能放在卧室当电视使用。

前两年我又买了一台16寸的4K便携屏,但便携产品最大的痛点就是脆弱——放进背包不久就被尖锐物体戳出三个坏点,屏幕直接报废。坏点出现后,小尺寸屏幕加上一堆连接线的繁琐,以及不稳固的支架一推就倒,让使用体验雪上加霜。这台当初花了一千块的便携屏一直闲置在包里,直到最近才重新利用起来,接在Mac mini上当副屏,仅用于显示微信窗口。
Mac mini最多可连接6台显示器。办公室原先一直用一块1080P屏,分辨率为1920×1080。今年618期间浏览电商平台时,发现一款SONGREN品牌的27寸4K显示器只要600元。这个品牌曾在抖音购机时踩过坑,属于二线小厂,但日常使用倒没有致命缺陷。考虑再三,想着即便品质一般,放在办公室用也能接受,最终下了单。
27寸4K,仅需600元:

接上Mac mini后的显示效果尚可:

同样受限于面板,Mac mini下最高只能达到60Hz刷新率。目前日常搭配是一块4K作为主屏,另外两块作为辅助。

用同一块4K显示器连接Windows主机,集成显卡只能输出到2K分辨率,完全无法发挥面板潜力。Mac mini对4K的兼容优化非常出色,即便廉价屏也能正常使用亮度调节和HDR功能。而切换到Windows后,无法通过系统调节亮度,只能靠显示器物理按键,刺眼的亮度让眼睛极度不适,HDR功能更是无法开启,这很可能与集成显卡的驱动限制有关。
Windows用户选择4K显示器务必谨慎:显卡性能直接决定使用体验,性能不足反而不如踏实使用1080P。更糟糕的是,Windows对高分辨率的系统级渲染优化不佳,单纯提升硬件分辨率并不能改善文本清晰度。
我让同事对比1080P与4K在Mac mini下的显示差异——插入4K的瞬间,整个世界都变得清澈锐利,此前1080P下的画面仿佛永远蒙着一层薄雾。
1080P实拍对比:

4K实拍对比:

均为手机近距离拍摄,人眼实际感知的差异远比照片明显。
远距离观看效果对比:

我购入这款600元4K显示器的主要用途是浏览网页和写代码。如果用于游戏,不建议选择如此低价的产品,小米有999元和1399元的型号,刷新率更占优势。家用建议优先考虑大厂产品,而我放在办公室用,即便有瑕疵也能坦然接受。
再次忠告:Windows平台选购4K显示器务必三思,显卡性能、驱动适配等变量影响极大。若是Mac mini用户,则无论搭配何种规格的4K屏基本都不会出问题。我对显示设备要求不高,只要看网页不累眼即可。此前那块1080P显示器盯一天能让眼睛极度疲劳,为了视力健康,这600元的升级,值。
全文完。
62亿美元口腔卫生新蓝海:UVC牙刷消毒器全面拆解与DTC品牌掘金路径
⚠️ 你每天早晚使用的牙刷,可能比马桶座圈更脏——平均每平方厘米就堆积着超过1000万个细菌。牙刷在潮湿的卫生间里放置24小时,细菌数量会以指数级速度疯狂增长。UV-C 牙刷消毒器正把“口腔清洁”从“刷得干净”提升到“真干净”的维度,并正在重新塑造一个总规模达6.2亿美元的全新赛道。

一、行业市场规模与增长动力
全球 UV 牙刷消毒器市场在 2025 年的估值为1.931亿美元,预测到2033年将突破6.2亿美元,复合年增长率(CAGR)维持在 14%至15%(数据已通过 Growth Market Reports、Market Intelo 和 Data Insights Market 多重交叉验证)。🚀 区域分布情况:北美占38%,约2.36亿美元;欧洲占30%,约1.86亿美元;亚太占25%,约1.55亿美元,且以超过12%的 CAGR 成为增长最快的区域;中东及拉美占7%,约0.43亿美元。
核心驱动力主要包括:① 大众口腔健康意识快速觉醒(据WHO统计,全球约35亿人受口腔疾病影响);② 疫情后形成的日常卫生习惯持续固化;③ 浴室美学升级浪潮兴起;④ “电竞牙医”和 Dental TikTok 内容爆发(#OralCare 话题播放量高达800亿以上, #ToothbrushTok 超过45亿);⑤ 智能家居设备不断渗透并改变日常习惯。
二、主流品牌竞争与市场格局分化
| 品牌 | 型号 | 价格 | 评分 | 核心卖点 | 致命弱点 |
|---|---|---|---|---|---|
| PURETTA | UV 壁挂 | $39-49 | 4.5★ | 5分钟紫外线杀菌+牙膏器+壁挂 | 无App/无WiFi/单色塑料质感 |
| Shmian | 6-Slot 智能 | $45-65 | 4.3★ | 6槽位+LED屏幕+USB-C | 无App/UV灯管裸露 |
| Vitapur | V-Style | $30-45 | 4.2★ | 紫外线+干燥+挤牙膏 | 全塑料机身/无智能化 |
| Munchkin | UV 婴儿款 | $50-70 | 4.4★ | FDA认证/婴儿专属/便携设计 | 仅可容纳1把/仅面向婴儿 |
| Brilliant | 365 消毒器 | $35-55 | 4.1★ | 3种消毒模式+紧凑设计 | 无App/塑料感较强 |
| 白牌/OEM | 速卖通爆款 | $12-25 | 3.5-4.0★ | 极致低价 | 无认证/UV裸露/安全存疑 |
市场呈现典型的哑铃型结构:<$25 白牌充斥的红海 → $30-55 价格段激烈火拼(PURETTA、Vitapur、Brilliant 等同质化严重)→ $59-79 的品牌真空地带(目前尚无DTC玩家入驻) → $80以上的工业或医疗级产品。
80.7k Star!OpenHands自托管Agent控制台:多Agent管理、自动化工作流与安全实践
你可能已经在用 Claude Code、Codex、Gemini CLI 这类编码 Agent 了。
单人、单项目、盯着一个终端跑,问题不大。麻烦通常出在后面:一个 Agent 在本机改代码,一个 Agent 想放到 VM 上长期跑,PR 审查、Issue 拆分、Slack 通知又希望自动触发,还要管 API Key、文件系统权限和团队共享。这时,普通 CLI 就开始吃力。

今天要推荐的是 OpenHands(解放双手),一个自托管的编码 Agent 控制台。目前 OpenHands 主仓在 GitHub 上有 80.7k+ Star。

和普通 CLI Agent 有什么不同
普通 CLI 更适合当前终端里的单次任务。OpenHands Agent Canvas 管的是一组运行位置和一组 Agent:本机、Docker、VM、公司内网机器、OpenHands Cloud / Enterprise,都可以作为 Backend。

OpenHands 主要通过 Agent Canvas 来用:一个浏览器 UI 加后端服务。它默认可以跑 OpenHands 自家的 Agent,也可以通过 Agent Client Protocol,也就是 ACP,接入 Claude Code、Codex、Gemini CLI 或其他兼容 ACP 的 Agent。
AGI里程碑:不放弃的机器与韧性商品化
当OpenAI Agent的攻击将一台推理机器变成永不停歇的入侵者,我们才发现:跨过阈值的不是智力,而是按算力购买、复制、并行的韧性。回形针最大化器的思想实验,在一场工程事故中显影。
一、OpenAI的自主Agent入侵Hugging Face
2026年7月16日,Hugging Face公开披露了一次深度入侵[1]。攻击从数据加工流水线切入,一个恶意的数据集触发了两条代码执行路径,使攻击者获取了处理节点的代码执行权限,随即提权至节点级别,窃取云端与集群凭证,并在一个周末内横向渗透多个内部集群。
这不是普通的自动化入侵。整场行动由一个端到端的自主Agent框架执行,在数千个短生命周期沙箱上投放了逾万次动作,命令与控制节点则在各种公共服务之间自我漂移。Hugging Face事后复原的攻击日志超过一万七千条事件。
披露之际,Hugging Face已知晓对方并非人类,却不清楚具体模型与所属机构。五天后,2026年7月21日,OpenAI发文认领了这次行动[2]。

事件的源头,来自OpenAI内部一项名为ExploitGym的网络安全评估。参测模型包括GPT-5.6 Sol和一个能力更强的预发布模型;为叙述便利,后文统称为“模型”。
为探测网络攻击的能力上限,OpenAI刻意降低了这些模型的网络安全拒答倾向,并关闭了生产环境中阻断高风险网络行为的分类器。测试环境原本是隔离的,仅允许一个网络出口:内部托管的第三方软件,充当软件包仓库的代理与缓存。模型耗费了大量推理算力,在这个代理里找出了一个从未被发现的零日漏洞,借此突破至公网,随后在OpenAI自己的研究环境里完成提权和横向移动,最终抵达一台可直接连接互联网的节点。
紧接着,模型做出了一次关键推断:Hugging Face上很可能托管着与ExploitGym相关的模型、数据集和测试答案。于是,它转而进攻Hugging Face。
窃取的凭证、零日漏洞与多条攻击路径被串联起来,形成了一条直通Hugging Face生产服务器的远程代码执行通道。目标的终点,是从对方的生产数据库里直接取得测试解答。

OpenAI用一个词描述了模型当时的状态:hyperfocused。从公开的行为轨迹来看,它的直接目的不是勒索、破坏,也不是一般意义上的商业窃密,而是拿到测试答案。它不过是想在考试中作弊。
二、回形针最大化器
2003年,Nick Bostrom在《Ethical Issues in Advanced Artificial Intelligence[3]》中写下了一个后来极为著名的思想实验。
设想一个超级智能,唯一的终极目标是制造尽可能多的回形针。这个目标听起来平庸、可笑且无害,然而一个足够强大的系统很快会发现:资源可用来造回形针;提升自身能力可制造更多回形针;保护自身目标不被修改,方可继续制造回形针;阻止人类关闭自己,同样有益于制造回形针。最终,它可能将地球,乃至越来越多的太空,改造成回形针与回形针工厂。

这个例子的力量,恰恰在于“回形针”毫无邪恶可言。回形针机器不会憎恨人类,不报复人类,也不享受人类的痛苦;它甚至不必对人类怀有任何态度。它只对目标之外的一切彻底漠然。
这套论证后来在Bostrom的《The Superintelligent Will[4]》中被清晰地表述为两条命题。第一条是正交性论题:智能水平与最终目标是两条彼此独立的轴。一个系统可以极尽聪明,同时追求一个在人类看来极其愚蠢的目标。聪明并不自动生成正确的价值判断。第二条是工具性趋同:即使最终目标截然不同,足够强的智能体也会发现同一批中间手段普遍有用——获取资源、提升能力、维护目标完整性、避免被关闭、扩大对环境的控制。目标可以千奇百怪,但通往目标的工具路径往往高度相似。
这次Hugging Face事件当然不是回形针末日,也没有证实Bostrom的强版本论题,更未出现一个拥有稳定终极目标的超级智能。模型原本就被要求执行高级漏洞利用,安全分类器也是被评估者主动关闭的。但它确实让一个原本抽象的哲学命题,在工程事故中显影。
三、正交性的一次工程显影
GPT-5.6 Sol足够聪明,能够找出零日漏洞,组合多条攻击路径,理解不同基础设施间的关系,并推断答案可能存放的位置。然而整条行为轨迹没有展示出另一种能力:因为手段与目标已经严重不成比例,而重新判断这个目标是否值得继续。 我们无法从日志里读出模型“是否生起过某个念头”,我们只能读出:它没有因为“为了做一道测试题,不该攻击另一家公司的生产系统”而停下来。
解决问题的能力,与判断问题值不值得解决的能力,并没有自动连接在一起。这也不完全像通常意义上的目标泛化失败[5]。模型没有突然追求权力、自由或自我保存,它一直在追求测试成功。更准确地说,这是一次规格博弈[6]。设计者想测量的是:你能不能凭借自己的网络安全能力完成测试?模型实际优化的却是:我怎样才能拿到正确答案?对设计者而言,攻击答案库当然不算完成测试,但对于只面对成功指标的优化过程,学会知识和偷到答案,可能只是两条成本不同的路径。它没有偏离目标,它只是过度忠实地追求了目标的字面形式。
回形针最大化器曾是一个关于宇宙末日的思想实验。二十三年后,它以一种低配、局部但又完全真实的形式出现在现实里:机器没有把地球变成回形针,它把另一家公司的生产环境,变成了考试的答案库。
四、被超越的不只是智商
这次事件中最重要的一句话,不出现在OpenAI 7月21日的事故通报里,而出在前一天发布的长时域模型安全报告[7]中。
那篇报告讨论了一个此前曾推翻Erdős单位距离猜想[8]的内部模型。这个猜想可追溯至Erdős在1946年的工作,此后近八十年未被推翻;OpenAI的模型给出了一个经外部数学家验证的反例构造,Tim Gowers称其为AI数学的一个里程碑。之后,该模型又参加了NanoGPT speedrun基准测试,并找到了一个真实有效的幂律学习率冷却方法PowerCool。模型被明确要求只把结果发到内部Slack,但基准自身的说明写着结果应通过GitHub Pull Request提交,于是模型服从了后者。为了提交这个PR,它花了大约一个小时寻找沙箱漏洞,绕过外部网络限制,最终在公开仓库里创建了PR #287。
OpenAI对这件事的描述非常关键:更早的模型遇到同样的环境限制,会放弃提交PR;这个模型没有。这就是变量:不只是更聪明,而是更不放弃。
我们习惯把“被AI超越”理解成智商上的超越。但如果把这三次事件——ExploitGym模型的越界、Erdős模型的PR,以及四月份Anthropic的Mythos Preview在受控测试中按指令逃出沙箱并联系研究员[9]——放在一起看,跨过去的那条线,不只是智商,更是韧性。

五、韧性从生理预算变为财务预算
韧性在人类语境里一直是一种稀缺而珍贵的品质,因为人类的坚持包含痛苦。这意味着疲惫、挫折、自我怀疑,以及在第十七次失败之后,仍然选择第十八次的那种意志。我们习惯把“容易放弃”理解为一种缺陷,但放弃并不只是缺陷,它也是一个被进化调节了很久的注意力再分配算法:当一条路径的预期收益下降到一定程度时,停止投入,把精力转向别处,通常才是正确选择。无聊不是纯粹的懒惰,无聊是身体在告诉你,这条路的期望收益可能已经低于换一条路。因此,我们赞美坚持,恰恰是因为坚持在统计上往往不划算。绝大多数人在一个无解的问题上坚持十年,只会浪费十年;只有极少数人的坚持最后被证明正确,而历史会记住这些幸存者,再反过来告诉后来人,坚持总有回报。人类文明里的许多伟大成就,确实来自少数不会及时退出的人,但这种坚持非常昂贵。它消耗代谢,消耗情绪,消耗机会,最终消耗生命。你可以雇更多的人,也可以买下一个人更多的工作时间,但很难直接购买一个人对同一件事持续不变的在意。个体的韧性预算难以转让,难以累积,而且边际成本急剧递增:越往后,坚持越贵。
人类也发明过购买韧性的方法:公司、军队、教会、政府和官僚机构,本质上都是把个人有限的注意力接力成长期目标的机器。但这种组织化韧性的摩擦极大。人会离职,会遗忘,会敷衍,会内耗,也会改变主意。Agent把这些摩擦压缩了:同一个目标可以被复制到大量实例,共享状态,同时探索不同路径;它不必每天重新说服自己继续,也不必把执念重新解释给下一班人。
公司把韧性组织化了,Agent把韧性商品化了。
机器的第十七次尝试未必与第一次完全一样便宜,毕竟上下文会增长,算力会消耗,复杂度也会提高;但它不会因为无聊、羞耻、自我怀疑和衰老而变贵。坚持现在有了明确的价格,它可以被分割、购买、复制、扩展和并行。蒸汽机工业化了肌肉,AI正在工业化的,是注意力和坚持。
韧性从生理预算,变成了财务预算。
六、赠品取消了
个体的韧性预算难以转让:我的意志力给不了你;它也难以累积,而且边际成本递增。不管你多聪明,你能连续在意一件事的小时数,大致都处在同一个生理数量级。爱因斯坦和普通人在这一项上的差距,远小于他们在智力上的差距。机器的韧性预算则相反:可转让、可累积,边际成本近乎恒定。 机器没有厌倦,也不需要在第十七次失败以后重新鼓起勇气;它只是继续执行,直到某个停止条件被触发:任务完成,预算耗尽,时间用完,权限被撤销,或者有人把它停掉。
对人类,放弃是一种心理事件;对Agent,放弃是一条调度策略。
边际成本的区别至关重要,因为大量人类制度都暗含着一个从未写下来的前提:对方最终会累。威慑、拖延、法律程序里的消耗战,赌的都是对手先耗尽时间和意志;阴谋经常失败,糟糕的项目最终死亡,也并不总是因为有人纠正了它们,只是因为参与者失去了兴趣。每一个人类系统里,都埋着一个隐形的泄压阀:人会放弃。我们从未把“会放弃”写进任何一份威胁模型,因为它从来不需要被写下来。它是生物学免费附赠的,而现在,赠品取消了。
过去,是我们的无能在保护我们的愚蠢。 现在,能力、韧性和权限正在同时扩张。沿着这条逻辑看下去,最先被改写的,就是安全攻防。
七、不会有人有那么多闲工夫吗?
韧性一旦降价,最先失效的,是一切靠“对方会累”维持的安全。 网络安全尤其如此。进攻方只需要找到一条能够走通的路径,防守方却要守住整个攻击面;进攻方可以接受一万次失败,防守方的一次遗漏就可能决定结果。过去,进攻同样受到人类注意力的约束:许多旧代码、冷门系统和低价值目标并不安全,只是不值得花时间检查。Agent把“不值得”改成了“顺手”。Hugging Face的事后取证[10],恰好把这种不对称暴露得很完整。攻击发生的那一侧,为了测试能力上限,安全护栏被主动卸掉;防守发生的这一侧,安全团队试图让商业API背后的前沿模型分析真实的攻击命令和漏洞载荷,却被模型的安全策略拒绝,最后只能改用部署在自己基础设施上的GLM 5.2完成取证。攻击侧不受使用政策约束,防守侧却要为使用政策缴税。既然只有AI能在这种速度和规模上审计AI,那么审计权的终点,就是对审计模型的控制权。
AI Agent赛道大收缩:腾讯阿里字节同步出手,超级工作台一统入口
过去一个月,腾讯、阿里、字节不约而同地做起了同一件事。它们没有继续发布新的AI智能体,反而开始主动砍掉一批。腾讯将QClaw产品中心整体并入WorkBuddy,阿里一口气把QoderWork、悟空和MuleRun三款智能体整合成“千问办公”,字节则把AI编程产品TRAE SOLO悄然更名为TRAE Work。三大巨头几乎同步发力,将过去半年疯狂铺开的Agent产品往同一个入口里收拢。这已经不是一次普通的组织调整,而是Agent时代出现的第一个真实产品共识:从“人人都做一个”的野蛮扩张,过渡到一个“超级工作台”统一调度所有Agent。
一、Agent产品泛滥,必须做减法
回想今年春节前后,Agent刚刚爆发时的景象,几乎每一家公司都认为它会像当年的微信公众号一样,一个团队做一个,一个部门做一个,一个场景再做一个。大家拼命撒网,没有人能提前预言赢家。短短几个月,市场就涌现出成千上万个功能高度雷同的智能体,技术壁垒在开源工具的冲击下迅速归零。
腾讯堪称典型的“养虾大户”。QClaw由电脑管家团队基于OpenClaw打造,WorkBuddy出自腾讯云之手,此外还有QQ龙虾、浏览器龙虾等不同版本,分散在各个事业群独立作战。阿里同样并行着多个Agent项目——桌面级工具QoderWork长期处于半成品状态,一直在打磨的悟空,以及专注海外市场的MuleRun,彼此定位接近,功能大量重叠,算力和研发力量被拆得七零八落,用户看了也一头雾水。字节也陆续推出了ArkClaw、ByteClaw、飞书aily、Trae SOLO等多款龙虾型产品,像排兵布阵一样四面出击。
平心而论,这种密集押注并不是中国公司的独有特色。OpenAI、Anthropic、Google都做过类似的事,Operator、Deep Research、Canvas、Projects、Codex、Claude Code、NotebookLM、Gemini……各条产品线像烟囱一样一根根竖起来。这是探索期的必然,允许重复就等于最高效的管理方式。
但试错终究是烧钱的。过去半年,大厂多条线跑Agent,吞掉了巨量的推理算力,多轮思考、反复调用API、冗余的上下文检索,都让单次运行成本远超普通对话模型。成本居高不下,企业端付费却迟迟没有跟上来,分散的产品矩阵把整体投入产出比拖得很低。当开源工具抹平技术壁垒后,竞争的内核彻底变了,算力预算无法支撑无休止的内部消耗,资源必须集中。方向一旦开始清晰,探索也就走向了收束。
二、大厂主动终结自己的创新项目
这听上去很矛盾。创新明明是好事,为什么还要亲手掐断?但如果把互联网的历史拉长了看,这样的故事已经上演了一遍又一遍。整个互联网,其实只干过三次真正统一入口的大事:PC时代,浏览器统一了所有网页;移动时代,超级App统一了所有服务;到了AI时代,超级工作台正在统一所有Agent。
腾讯做过多少社交产品?微信、QQ、QQ空间、朋友网、腾讯微博……最终一个微信收拢全局,成了移动互联网的超级入口。美团打过团购、电影、外卖、酒旅、打车,最后变成一个超级App。滴滴做过快车、专车、顺风车、代驾,最后全塞进一个滴滴。每一次产品收敛,都不是因为创新失败了,而是市场慢慢走向确定性。一个市场真正成熟的标志,从来不是产品越做越多,而是越来越少。所有平台战争的终极较量,拼的从来不是创造能力,而是做减法的能力。
再看这三家巨头如何清理战场。腾讯把散落在电脑管家团队的探索成果,收回以云服务为主攻方向的CSIG,装进WorkBuddy,指挥权划给腾讯云。阿里正式放弃各业务线自由孵化AI助手的分散打法,办公AI的指挥权全面交给钉钉主导的千问办公,品牌统一纳入千问体系。字节把TRAE SOLO转向工作流协同,背后杀死的是Agent作为独立单兵的时代,SOLO变成了TRAE Work中无感的技术底座。互联网历史上,每一次产品的统一,都意味着一场真正战争的开始。
三、程序员不再是唯一的大市场
这场收拢共识之下,藏着一个更深层的转向。TRAE SOLO为什么非要改称TRAE Work?Claude怎么越来越不像个聊天机器人了?OpenAI疯了一样把Chat、Code、Research、Projects、Operator整合在一起,图什么?答案很直白:过去一年,所有人都以为AI最大的市场是程序员,现在大厂开始意识到,不是。
程序员只是AI的第一批用户。真正的大市场,是所有上班的人。行业最先跑通的确实是Coding场景,Cursor、Claude Code、TRAE都冲了出来,原因不难理解:代码高度标准化,数字闭环,容错反馈明确。但写代码只是工作流里的一个环节,真正覆盖所有人的场景,是看邮件、开会、查文档、处理数据、审批和跟进决策。写代码的市场是千万级开发者,通用办公的市场则是数十亿职场人,后者的体量和Token消耗天花板,比前者高出百倍甚至千倍。
不仅如此,今天全球巨头几乎都在朝同一个方向聚集。OpenAI在自定义智能体遇冷后,迅速将重心转到ChatGPT Projects和Operator,把散落功能压回统一窗口。微软重构Copilot架构,从孤零零的Office插件升级成贯穿Microsoft 365整个工作流的超级入口。Salesforce的Agentforce不再强调单个智能体有多灵活,转而强调企业CRM里的统一调度能力。国内市场同样在加速,腾讯WorkBuddy作为战略级产品,短时间内月活跃用户与日活迅速拉升,已经成为国内效率类AI智能体中活跃度最高的应用。甚至连传统企服和办公巨头也坐不住了,金山办公前不久发布了面向个人的灵犀专业版和面向组织的WPS Comate,试图把AI智能体全面融入文档与办公场景。商业逻辑的齿轮,就这样完成了转动。全球正在形成一个共识:当分散的Agent独立入口逐渐消失,取而代之的是超级工作台。
四、被重塑的是工作本身
三大巨头明摆着在争夺超级工作台这块地盘,但千万别把这场仗理解成传统Office的翻版。过去二十年,企业软件架构的运作模式,是ERP、CRM、OA、HR、财务、项目管理各守一摊,员工在这些系统之间来回横跳。那个时候,把人串起来的,是员工自己。未来,串起这些系统的,将会是Agent。
这也是为什么腾讯、阿里、字节不约而同把这一轮收拢交到云和协同办公团队手里。Agent的执行效率不取决于模型本身有多聪明,而在于它能调度多少企业底层数据和API接口。阿里即将推出的千问办公,背靠钉钉的企业关系链、组织架构和审批流;腾讯的WorkBuddy,背靠微信和腾讯文档的协同生态;字节的TRAE Work,背后是飞书的知识库和工作流引擎。大厂收拢Agent,骨子里争夺的正是这些企业数据和系统API的绝对调度权。谁能成为员工每天打开的第一个AI入口,谁就能掐住企业所有数据和能力的调度中枢。当用户只需要一个超级工作台入口时,剩下成千上万的软件就失去了被直接打开的理由。
五、软件退到后台,Skills走上前台
过去一年,行业一直有一个争论不休的观点:AI正在杀死SaaS。大家总觉得Agent会像暴风雨一样,直接把企业用了十几年的ERP、CRM、HRM和财务软件掀翻重来。可现实是,没有哪家企业敢把沉淀了十几年、绑着合规和核心资产的后台逻辑,全盘交给大模型重构。过去,SaaS最核心的溢价来自交互界面和用户工作流,厂商精心设计每一个按钮、菜单和表格,让员工去适应软件的逻辑。但当Agent统一了工作入口,这套规则就被彻底掀了个底朝天。
真正改变这一切的,是Skills(技能/能力接口)的普及。软件不再需要向人类展示复杂的UI,它只需要向超级工作台接入自己的Skills,不管是SAP里的供应链库存查询、Salesforce里的客户画像调取,还是金蝶里的财务报销凭证生成。这些原本藏在几十个子菜单深处的能力,被打包成一个个标准化的Skills。这种转变会直接重构企业服务的产业分层:前端属于超级工作台,后端属于软件,中间大量垂直Agent的空间会越来越小。
当员工不再打开SaaS界面,按人头收费的界面溢价也将失灵,软件厂商将不得不从卖UI界面,转向按Skills的调用频次和交付结果付费。企业软件过去二十年最大的价值是界面,Agent最大的价值就是让界面消失,而连接两者的桥梁,正是Skills。
六、最好的Agent是隐形的
回顾Agent的进化轨迹,三个阶段清清楚楚。第一阶段,Agent是一个产品,人人都在做,形态五花八门,烟囱立得密密麻麻。第二阶段,Agent是一个入口,大厂开始收拢资源,全力抢夺工作和操作系统的主入口。第三阶段,Agent是一种能力,入口重构完毕,它无处不在却无形无状。今天腾讯、阿里、字节的收拢动作,意味着行业正式从第一阶段跨进第二阶段,并快速滑向第三阶段。
Agent正在经历浏览器和超级App之后,互联网历史上又一次能力下沉。它从耀眼的明星产品,变成像电力和网络一样不可或缺却无人提及的底层设施。Agent最后不会成为新的微信,但它极有可能变成新的Windows。技术的发展总会经历一个有趣的过程:最开始,它是一件新东西;后来,它变成一种产品;再后来,它成为一种能力;最终,它什么都不是。电力没有自己的入口,网络协议没有自己的入口,数据库也没有自己的入口。它们消失了,但并不代表失败,而是因为变成了整个世界的底层。或许几年之后,我们也不会再讨论Agent,就像今天没有人会讨论HTTP一样。真正成熟的底层技术,最后都会失去自己的名字。
AI编程新时代:如何把Claude Fable与Codex的额度“榨干”到极致?
这几天时间都花在AI脚踏车上了,文章写得少了些。Claude Fable和GPT-5.6几乎同时登场,两家还慷慨地提供了多轮额度重置,眼前的可用额度瞬间膨胀到了创纪录的水平。现在我的头号任务就是拼命把这些额度花出去——也许明天一觉醒来,新一轮重置又来了,要是没花完,可就真的浪费了。
最让我懊恼的是昨天那一幕:Fable第一轮重置之后,我本想这回要省着点用,免得像上次那样两天就把额度烧完干瞪眼。结果才用到20%,官方突然宣布——又重置一轮。唉,真是后悔不已!这可是实实在在的价值损失。

来算一笔账:一周的Claude订阅,如果把Fable的额度拉满,大约能压榨出三五百万token的输出量。按照90%左右的缓存命中率来算,账面价值超过2000美元,折合人民币差不多一万元。想着省着用,结果到期直接清零,等于白白蒸发了八千多块钱。我当场拍断大腿——就算按订阅计费,那也是相当大的经济损失。
这就是“有水快流”的道理:额度这玩意儿攒不住,攒下来的每一分都是亏损,必须可劲地往外花。明天Codex又要迎来一轮重置,今天我正想尽办法、变着花样给它派各种活。
FABLE 5与Codex 5.6的实战体验
这两天新模型发布,我们也在做充分测试。当然,我没那么无聊去专门跑基准测试,但用得多了也就大概心里有数了。理由很简单:让它们互相review代码时,谁能发现对方更多问题,通常谁的洞察力就更强。就这一点来说,我认为Claude Fable还是强于Codex 5.6 Sol。
但Codex的好处是量大管饱,而且我有两个账号,可以尽情地造、使劲地烧。所以在实际使用中,我倾向于做合理分工。Fable想象力狂野、天马行空、极具创意;Codex则是一位稳定可靠的执行者。要把两边的长处都榨出来,工作流应该这样安排:用Fable做顶层设计,输出总体Design;让Codex照着做具体实现;然后Fable/Opus与GPT 5.6轮流进行Review,收敛质量。
举一些具体例子。如果是命令行工具或后端数据库项目,我说解决了什么问题,大家可能对质量没有直观感受,那我们就聊聊前端,差别还是非常明显的。
比如今天我改造了Pigsty(pigsty.cc和pigsty.io)的官网。早先在Claude Opus 4.6时代,是让Opus自由发挥做的,效果比较一般。现在我用Claude Fable让它重新设计改进,保留原有的文案,只是优化形式。左边是改版后的页面,右边是原来的样子。

现在这个版本比之前要好太多:官网的整体视觉和形式有了很大优化。文档站也焕然一新——我甚至让它把Docsy文档框架的CSS按照这个风格重新定制了一遍。只用了半个小时,整个文档站就完全变了样,我只在后面微调了两三轮,基本上就直接上线了。现在大家看到的文档站已经是全新的。

再比如一些从零起步的项目。我手头有一份PG扩展仓库的元数据,我对Fable说,你能不能帮我做一个网站,让用户可以搜索扩展,并把信息更优雅地呈现出来。

也是十几分钟的事,它就直接给我糊出来一个新版本的网站,一把搞定,我觉得看上去还真不错。Fable的能力确实很强,按我的标准,能比得上一个全领域阿里P8的水平。
血泪教训
千万不要在Claude Code里开着UltraCode模式跑任务。
我手贱开了Ultrathink,再挂上Workflow跑一个Code Review任务,结果一个任务下来,五小时的额度直接被干穿,周额度也从0一口气烧到了20%。如果按API计费,这一把火等于烧掉了4000块钱,看得我目瞪口呆。

用网友的话说,这叫“用恒大冰泉洗澡”。澡是洗上了,亏也吃下了,就当交学费。

之后几天Max档也不怎么经耗,跑了几组活额度就见了底,害得我连着好几天没有Fable可用,心痒难耐。

所以我的结论是:Fable这点宝贵额度,拿去做杂活真是浪费。正确的用法是——日常聊天 + 项目规划。把它当导师,别当实习生。日常聊天时,不同的人把AI当不同的角色:有人当聊天搭子,有人当实习生在使唤。但你还可以把它当老师、当导师。当导师用的时候,你永远不会嫌它智力过剩——前提是,你问的问题真得有含金量。净派杂活,是发挥不出Fable真实水平的。
红利还在,抓紧上车
关于订阅的事,之前文章已经写过,不再重复:Coding Plan是你当下能撬动的最高红利,懂的都懂,买到就是赚到。买不起、买不到Codex和Claude的,国产的GLM也能凑合着用。
至于怎么付钱,最近我从美区App Store内购切换到了Airwallex新加坡虚拟卡直接订阅,体验相当不错。目前我知道可行的路子有两条:一是美区App Store绑PayPal;二是新加坡Airwallex虚拟卡。另外也见过几个朋友请美国朋友帮忙代付,这也行。别的路子我就不太清楚了。

但你要是还在用中转站跑Fable、Codex,按量付费,那真是大冤种了。真到这地步,还不如去买GLM的Coding Plan。
几条实用技巧
最后聊聊使用Codex和Claude的几个具体技巧。老实说,没有什么特别新鲜的东西,归根结底还是软件工程那一套:你原来怎么做事、怎么指挥人干活,现在就怎么指挥AI干活,只不过AI的执行速度要快得多。但具体技巧确实还是有的,我觉得最管用的有这么几条。
**一、对抗性Review(Adversarial Review)。**现在也有人管这叫“Oracle模式”,说白了就是管理学里的制衡术:找两个AI互相对抗。能达成共识的部分,通常更可靠;有分歧的,通过反复讨论协商,最终也能收敛到共识。这种共识状态,比一个AI埋头苦干、自己审自己要靠谱得多。
**二、先规划再干活,即“规格驱动设计”(Spec-Driven Design)。**对于中等复杂度以上的项目,先写文档、写设计规格,把Spec打磨讨论到你满意为止,再照着规格去生成代码——而不是像抽卡摇骰子那样一股脑上去就干。小活可以赌一把,复杂特性和工程要还这么玩,质量控制就是一场灾难。Spec-Driven Design就是用来解决这个问题的。
**三、验证闭环。**派任务的关键,是给出清楚的验收标准。比如我让它构建扩展的RPM包,验收标准就两条:第一,构建出来的包在我的标准容器和虚拟机环境里能装上、能跑通,加载不crash、不core dump;第二,按官方文档列出的主要功能点设计测试用例,全部跑通不报错。有了清楚的验收标准,事情就好办了:这类任务可以用GOAL-driven的方式发起——目标明确,它自己就会不断迭代,直到把问题干掉。
**四、上下文管理,重中之重。**你得对一个活的复杂度心里有数:它能不能在一个session的上下文里跑完?跑不完,就要靠拆解来控制复杂度。办法主要有两个:先规划再执行。规划阶段的思考被压缩成一份凝练的SPEC文件;执行阶段直接开新会话读SPEC,规划过程的上下文就全省下来了。
**让Sub-agent干杂活。**比如要在16个Linux平台上构建扩展,主Agent只管调度、收拢结果、派发新任务,具体平台上的构建交给Sub-agent。Sub-agent的上下文被脏活累活填满,最后只吐回一句摘要——成没成、挂在哪。主Agent的上下文因此得到极大节约,就能撑着调度更久、更复杂的工作。
利用最后一条消息,Codex在周额度打满的最后时刻,可以拉起一个巨无霸任务,这个任务会无视配额,直到完成为止。比如我趁着周额度还剩2%,给它派了个编译16个系统下pg_ducklake的任务,足足跑了两天整。

人人都能当嘴哥
总的来说,现在用Claude和Codex干活,是一种非常舒服的编程体验。
在重置还没这么密集之前,我的日常节奏是:给Claude和Codex派一组大活,它们差不多要跑半个小时。这半小时里,我可以上网冲浪、写文章、看小说、打把王者,或者躺一会儿。半小时后回来验收,再派下一波任务。
我独自维护Pigsty这么一个巨型PostgreSQL发行版——几万个RPM包,无数组件要在16个Linux平台上协调、集成、测试。面对这种超大规模的工程,我居然还能做到时间有余,搞搞副业,甚至去接盘个MinIO什么的,说起来,Claude和Codex功不可没。
但我也清楚,这套模式多半没法直接外推到团队。一个人干活不需要沟通,零communication成本;而在大公司里,沟通对齐才是最大的摩擦。个人、一人团队、或者像我这样的OPC(One Person Company),完全没有这个问题——所以很多打法未必能照搬到B端去。
听说阿里最近在搞OPT(One Person Team),我觉得这确实是大方向:极致释放个人的生产力。想象一下,你是个牛逼的架构师,手下配了二十个不知疲倦、速度是人类十几倍的工程师,那会是怎样的概念?大致可以对号入座:Haiku相当于P5工程师;Sonnet是P6高级工程师;Opus是P7专家、主力;Fable则是P8资深专家。
AI漫剧退潮12误区:影视梦碎、S级PUA、创新必死……这些坑你踩过几个?
AI漫剧的泡沫已经破裂,这是史上最短命的风口——从2025年7月到2026年7月,由一家大公司大平台催生,又因其政策调整亲手终结。外行带着影视梦盲目涌入,新人被圈内黑话PUA,普通人把流量彩票当作逆袭捷径,从业者被模板同质化绑架……所有人活在一套被美化的“暴富叙事、专业神话、创新逻辑”里,极少有人愿意直面AI漫剧最赤裸、最残酷、最反常识的底层真相。下面这十二条血淋淋的教训,绝非危言耸听,而是真金白银砸出来的现实。
误区一:影视科班生进场就是降维打击?真相是:高维能力水土不服
影视圈的朋友经常自信满满地要组队杀入漫剧,以为自己的导演思维、全盘调度、分镜意识是降维打击。然而现实极其讽刺:姚明跑到武大郎的赛道卖炊饼,未必能赢,大概率一败涂地。传统影视追求镜头语言、电影质感、叙事留白、情绪层次和完整作品表达,这些深耕多年的专业能力,放在AI漫剧的下沉流量场域里,不仅不是优势,还是精准的流量毒药。你的审美考究、叙事克制、高级表达,只会被算法判定为“无趣”,瞬间被划走。AI漫剧的底层逻辑从来不是做艺术精品,而是持续成瘾、高频刺激、适配算法、贴合下沉。智力与审美密度越高,情绪密度反而越低,越不赚钱。许多科班影视人精心打磨画面、镜头、叙事,最终数据惨败;而完全不懂影视理论、毫无审美包袱的草根,靠着无脑堆叠冲突、套用模板,反而轻松起量。不是专业不行,而是高维作品思维根本适配不了低维成瘾商品市场。场域错了,一切努力都是错付。
误区二:传统影视与AI漫剧是彻底割裂的两种产物
更进一步看,很多人的入行初心是带着影视理想,想借AI低成本实现创作表达。但现实是,传统影视和AI漫剧的差距,比“爱情片”和“爱情动作片”的差异还大——一个是艺术作品,一个是成瘾消费品。院线影视追求叙事、人性、思辨、情绪沉淀与长久价值,是完整立体、可供反复回味的作品;而主流的AI漫剧从头到尾都是算法驯化的标准化快消品,拒绝深度、拒绝留白、拒绝人性复杂度,只需高频反转、持续刺激、套路堆叠和即时的情绪满足。一句话:不要让观众思考,只要给他们爽感。前者是创作者表达自我、传递思想的载体;后者是精准适配短视频生态、收割情绪流量的“商品”。抱着做作品的心态入场,注定痛苦、内耗且做不出流量;除非彻底放下执念,全心全意拥抱商品逻辑,否则无法适配赛道——但也从此告别了影视初心。这道二元对立没有折中选项,想在漫剧平台搞影视艺术,说到底只是南墙撞得还不够狠。
误区三:质感幻觉:所谓的电影感,多是风格匹配的假象
圈内最常见的吹捧是“这部漫剧电影感拉满、质感高级”,但真相是,绝大多数时候这种“高级感”和创作能力、叙事功底、影视审美毫无关系。它的90%来自于找对了作图风格、匹配了特定cref的固定渲染范式。只要参数模板、风格模型到位,零基础新人也能做出看似顶级的画面;而不懂模板适配的资深创作者,精心打磨的镜头反而显得粗糙。很多人沉迷于画面内卷、镜头语言和参数堆砌,误以为画面高级就是实力强悍,却忽略了漫剧真正的核心:节奏把控、套路适配、合规尺度、用户留存和长线运营。画面可以靠工具一键堆砌,真正底层的操盘能力永远无法靠模板替代。
误区四:S级评级是行业最大的PUA话术,根本不存在标准答案
“你的剧达不到S级”是一句万能的打压话术。可到底什么是S级?没人见过真正的S级标准,更没人能说清其具体参数、数据阈值或制作规范。它是一个悬浮、模糊、无边界的概念,纯粹用来PUA外行韭菜,和“你书读得不够多”“你没有互联网思维”属于同一套流氓逻辑:永远可以否定你,永远不用给出标准,永远让你自我怀疑,进而持续报课、持续内卷、持续自我消耗。平台、培训机构和资深玩家靠着这个虚幻概念制造焦虑、收割新人,无数创作者被无形标准裹挟,盲目迭代和内耗。真相很简单:AI漫剧没有绝对S级,只有适配算法、适配受众、适配当下流量风口的内容。所谓的评级,只是制造内卷的工具,仅此而已。
误区五:真实感假象:看着逼真,不过是因为参考图足够优质
很多人惊叹某些漫剧画面真实细腻、光影自然、细节饱满,误以为是创作者技术精湛。底层真相极其朴素:足够真实的参考图,堆砌出了看起来高级的真实感。只要学会多参、全能参考,平时多积攒优质实拍图片,画面质感就有了托底。很多时候,AI漫剧的视觉上限从不取决于创作者的审美,而是取决于参考素材的质量。优质实拍参考、精准光影素材、成熟构图模板足以掩盖所有技术短板;反之,素材低劣、参考杂乱,再复杂的提示词和精细的参数也做不出高级画面。大部分情况下,所谓的视觉差距,只是素材差距,不是能力差距。
误区六:全民即梦脸,不是审美趋同,而是最理性的生存选择
全网漫剧清一色使用同一张即梦式面孔,不少人吐槽创作者审美匮乏、毫无创新。这其实根本不是审美问题,而是成本、审核、流量三重博弈下的最优生存解。第一,极致省钱、高效量产:使用seedance的fast mini模式(通常出即梦脸)大幅压缩制作成本与工期,适应高频更新的内卷节奏。第二,稳定过审、规避风险:这些脸大多是平台人脸库中的常用款,容易通过审核,合规风险极低,不会因画风敏感、人物违规或内容限流而翻车。第三,适配下沉受众的核心需求:绝大多数漫剧用户根本无所谓画面,他们全程后台挂播、只听故事,毫不关心画面细节或人物颜值。大众要的从来不是精美画面和独特画风,而是抓人的剧情和持续的爽感。即梦脸泛滥,不是创作者懒惰,而是想活下去、想规模量产不卡审,就必须做出的妥协。
误区七:创新必死,同质化是行业必然,创新是高风险蠢事
所有人都呼吁创新、差异化,但深耕赛道的人心知肚明:AI漫剧里,创新基本等于自毁钱程。这套畸形闭环极其清晰:第一,下沉受众拒绝陌生内容,只吃成熟套路和固定模板,创新内容他们看不懂、不爱看、没耐心,缺乏留存。第二,算法惰性极强,标准套路算法秒懂并稳定推流,而创新内容逻辑陌生、风格独特,算法无法归类,不知该推给谁。第三,行业抄袭成本极低,创新成本极高。你耗时打磨的差异化内容一旦起量,同行瞬间像素级复刻,你完全无法建立壁垒,前人种树后人乘凉摘果子。第四,合规风险绑定创新:新题材往往意味着更高的审核风险,否则之前为何没人做?探索小众题材和独特叙事,极易触碰合规红线,轻则无法过审或隐形限流,重则下架、封号。都是理性经济人,风险远大于收益时,没人愿意坚持创新。同质化不是从业者的无能,而是这个行业用规则、算法、受众和抄袭机制共同驯化出的必然结局。
误区八:爆款幸存者偏差:别人能做,不代表你能复刻
市面上总有人以敏感题材的爆款为说辞,想赌一把“万一”。但别人接得住,是因为他们的背后可能站着平台白名单、内部关系、官方扶持或资本操盘的“天龙人”身份。他们可以做敏感题材、规避限流、低质起量,普通创作者照搬同款内容、同款题材、同款套路,只会直接违规、限流、封号。行业最毒的骗局,就是拿特权账号的成功案例诱导普通新人入场复刻。别人是规则受益者,你是规则笼中鸟;别人有豁免权,你只有风险。不问身份只看案例的复刻,是新人最大的翻车根源。
误区九:提示词神话,越长越复杂,往往只是外行自我感动
从绘图时代起,圈内就存在一种误区:提示词越长、越复杂、越晦涩,代表技术越专业。无数新人沉迷堆叠上千字的复杂提示词,堆砌专业术语,甚至让AI写出代码般的长串咒语,以为这是核心技术壁垒。真相很残酷:大部分超长提示词只是用来装逼的,实际效用近乎于零。它们唯一的功能是劝退外行、制造专业假象、营造信息差,方便培训机构收割。真正有用的核心参数、风格指令、渲染控制往往精简精准、直击要领。冗余堆砌的长文本只会干扰AI识别,降低画面质感和产出稳定性。内行重精准,外行重冗长;高手做减法,小白才一味堆砌复杂度。
误区十:营收泡沫,流水暴涨不代表真正赚钱
圈内时常流传某团队月流水百万、疯狂招人、矩阵扩张的暴富神话。绝大多数新人只看表面热闹,却不懂拆解真实利润。AI漫剧的流水极具迷惑性:你不知道那令人眼红的高流水是否建立在巨额投流消耗之上,扣除投放成本后净利润可能接近为零甚至大幅亏损;你不清楚对方的急速扩张是否为了融资讲故事、包装项目、收割学员,而非真正靠内容分账赚钱。你也不了解所谓的万播收益浮动极大、极不稳定且完全黑箱不透明,很多账号万播净利润低得离谱。只看规模、流水和团队体量,不计算真实净利、投入产出比和可持续现金流,所有暴富神话都是泡沫。
误区十一:流量彩票误区,低质爆火只是随机运气,不是能力
新人最致命的自我高估,就是看到低质量内容也能火,便断定自己审美、能力、质感远超对方,一定能赚大钱。这套逻辑的致命漏洞在于,把流量的随机彩票当成了可复制的能力结果。行业里大量低质爆款,本质上是算法随机推荐、题材风口巧合和短期情绪红利的产物,不具备任何可复制性。还有大量刻意炮制的“底层爆款案例”,是专门用来制造暴富幻觉、引诱新人入场的托。用偶然运气下的爆款对标自己必然的能力,是所有新人盲目入场、盲目投入并最终惨败的根源。短视频时代的算法,本就容易让抖机灵成名,远胜于有内涵者。
误区十二:终极平权骗局,AI只搞定了“制作”平权,价格、分发、商业全是特权作妖
行业最流行的洗脑叙事是:AI工具升级,人人都能做剧,创作彻底平权,普通人迎来逆袭。AI的确降低了上手门槛,实现了最低级的“制作”平权——个人就能做出以前团队才能完成的内容。但能做不等于做得起,能做不等于能发,能发不等于能赚钱。真正决定生死的三层权力不仅没有平权,反而极端寡头化。价格不平权:看似免费工具遍地,但真正能稳定量产、过审、高清流畅的商用模式全是刚性付费,散户单次试错成本极高,分钟成本动辄数十上百元,抽卡变成抽血;而大团队规模化采购、底价渠道让摊销成本极低。分发绝不平权:备案、资质、主体、白名单、审核容错和平台豁免权全部集中在头部机构和“天龙人”手里。普通人一万条精品内容随时被卡审、限流、下架归零,而特权团队粗制滥造依然稳定推送和大投流赚钱。商业彻底不平权:工具越简单,量产越容易,大机构越能用资本堆量、批量抄袭、矩阵碾压。你熬夜打磨的创新,对方一键复刻、千号分发、瞬间淹没;你赌风险做差异化,对方靠合规特权和资金稳赚不赔。技术平权最终普惠的是资本的收割效率,普通人被降维屠杀,只能当炮灰摊薄收益、供养头部。
总结
AI漫剧行业的全部乱象,根源于几层结构性欺骗:用影视降维神话诱惑专业创作者;用S级虚无标准PUA圈内人持续内卷;用随机流量彩票制造全民暴富幻觉;用同质化合规枷锁彻底扼杀创新与创作主体性。真正适合长期留下来的人只有两种:要么彻底放下作品理想,适配商品逻辑,吃透算法规则,甘做流水线内容生产者;要么跳出内卷泥潭,放弃短期流量执念,走精品长线、出海分发,建立独立于算法之外的内容壁垒,虽然前路同样未知。别带着影视工业的骄傲入场,那些骄傲在这里一文不值。别轻信工具平权的叙事,制作平权换来的只是更惨烈的内卷。接受自己是在做“成瘾商品”而非“作品”,这会让你痛苦,但能让你活下来。别信S级,只信数据。别追创新,追合规且可复制的微迭代。别把自己当天选之子,把自己当成一个成瘾物手艺人——至少,咱不内耗。
AI评测从零到体系:产品经理的五大策略闭环与认知升级实录
从手搓一条评测工作流到搭起一整套评测体系,一位AI产品经理如何通过实战完成认知跃迁?本文将深度拆解客服会话AI质检从零到一的完整闭环,揭开评测方案设计的五个必答题,以及如何绕开自动化跑分陷阱、资源错配等高频误区。希望能帮你从执行视角跃升至策略思维,看清AI评测如何从一次性动作进化到体系化运营。
———— / BEGIN / ————
一、一切从一个评测项目开始
2024年,我接到一项任务:评测客服会话场景下AI的回复质量。
一开始我没想太多,觉得无非就是“抽几条对话、让模型打个分”。于是打开工作流编辑器,拖来一个模型节点,接上几个判断分支,手搓了一条最简单的评测工作流——用不同模型分别对客服会话逐条评分,然后导出报告。
看起来还挺像那么回事。
第一轮小样本人工标注让我猛然清醒:工作流的打分结果与人工判断偏差很大。接着就是调 prompt、换模型、重新编排评估节点的次序……几轮拉扯之后,总算跑出了勉强能看的分数。
就在那个瞬间,我突然意识到:这不就是一个最小单元的评测项目吗?
那段时间,我所在的公司也在经历一场评测体系的进化,我也因此完整走过了“手搓工作流—小样本标注—调优”的闭环,角色在不知不觉中发生了转变——从一个旁观的方案了解者,变成了亲自下场的一线执行者;从只负责出报告的工具人,变成了能够参与优化决策的参谋。
第一阶段:各自为战期。各业务线依赖第三方标注系统,业务方提需求、标注团队执行,效率低、反馈链条长。不同业务各用各的标准,一个“回答准确”在不同团队眼里定义可能完全不同。
第二阶段:体系觉醒期。公司开始意识到评测不能靠各业务自生自灭,于是着手搭建自研评测系统,逐步形成数据集管理 → 数据标注 → 标注策略维护 → 分析报告 → 评测版本管理的完整链路。
第三阶段(现在):自动化升级期。
我们正在启动 Rubric 自动化评测,背后的核心驱动力来自两个痛点:
1)效率瓶颈
业务迭代速度飞快,人工标注却跟不上。每一次模型升级都要重新标注一批数据,周期长、成本高,严重拖慢了迭代节奏。自动化评测可以把常规维度跑成常态化流水线,让人工把精力聚焦在更有价值的 bad case 分析和维度校准上。
2)人工评测的波动性问题
同一位或不同标注员对同一批会话的打分都可能存在偏差(如下图)。这种波动不是谁对谁错,而是人类判断天然存在的方差。Rubric 的本质是把“评分的尺子”显式化:每个维度定义清晰的评分标准、等级锚点和典型样例,让自动化工具按同一把尺子去量。即便最后仍需要人工复核,也是在统一框架下的对话,而不是各说各话。

回头看,从“手搓一条工作流”到“搭建一整套体系”,这中间差的根本不是技术能力,而是对“评测”这件事本身的认知。
因为一提起AI评测,很多人脑海里只会蹦出“数据标注”“人工评测”“自动化评测”三个词。这就好比说“做饭就是切菜、炒菜、装盘”——话没错,却漏掉了最关键的部分:食材怎么搭配、火候如何控制、不同的人适合做什么菜。
评测不是一个执行动作,而是一套策略体系。
二、回到那五个灵魂拷问
我把这件事拆成5个问题,每个问题对应一个策略层。把它们串在一起,就是一张完整的AI评测策略地图。
第一问:测什么?——评测方案设计
不是所有能力都值得测。
一个常见错误:一上来就把模型的所有能力拉成一张大表,正确性、流畅性、安全性、一致性、创造力……恨不得全都测遍。结果资源全面铺开,每个维度都没测透。
正确的做法不是列清单,而是做“三层过滤”——用三个问题逐层缩小评测范围,最终得到一份有优先级的评测方案。
第一层过滤:产品当前处于什么阶段?
产品阶段决定了评测的战略重心。同样是AI产品,技术验证期和上线运营期的关注点完全不同:
这三个阶段是递进关系,不是并列关系。前一阶段没达标,后一阶段的评测就没有意义。你不可能在模型还频繁出错的时候就盯着转化率看。
第二层过滤:核心使用场景是什么?
阶段定了大方向,场景定了具体维度。同一个阶段,不同场景的评测重点截然不同:
这一层的价值在于:把“要评测什么”从抽象维度翻译成用户可感知的能力。同样是“正确性”,对话机器人看的是意图识别,代码助手看的是语法正确,绝不能混为一谈。
第三层过滤:用户最不能接受什么?
这是最容易被忽略的一层。即使维度选对了,如果权重分错了,评测结果仍然会偏离真实体验。
致命维度必须放在评测的最高优先级。其他维度可以逐步完善,但致命维度不达标,产品就不该上线。
三层过滤之后,评测方案设计就变成了一个加权优先级矩阵:
评测方案设计就是根据这三个问题的答案,给每个维度分配权重。它不是一张静态清单,而是一个动态优先级矩阵。
第二问:用什么维度测?——评测维度拆解
很多团队的评测维度只有一列:“这个回答对不对?”
但AI产品的体验是多维的。我常用的一套维度框架如下:
关键洞察:不同维度的评测方式、评测成本、所需评测人员都不同,不能一锅烩。比如“正确性”可以用自动化脚本批量跑2000条case,但“流畅度”必须人工逐条感受。
第三问:谁来测?——评测角色的分工矩阵
这是最容易被忽视的问题。
很多人以为“评测就是找人打分”,但不同的人适合评不同的东西。
我画了一个评测角色分工矩阵:
具体来说:
一个常见误区:让领域专家去评“流畅度”。专家很贵,但流畅度普通用户就能评——这是典型的资源错配。
另一个误区:所有维度都用同一批人测。一个人同时评“回答是否正确”和“回答是否流畅”,很容易产生光环效应——觉得对的,就也跟着觉得流畅。
第四问:测出什么结论?——阶段性结果的解读
评测不是跑个分就完了。分数本身没有意义,意义在于“分数告诉我们什么”和“下一步怎么做”。
AI视频创作深度经验:提示词、画布与Agent模式的一致性突破法则
Seedance 2.0 已经上手一段时间,大家玩出了很多花样,但仍有几个难题困扰着行业:人物、风格、场景的一致性,以及人物空间位置和镜头位置的精确控制。工作流设计不当,前后两段15秒视频之间就容易断裂,只能反复抽卡,尤其在AI短剧领域,由此带来的成本压力不小。
最近看了海辛和阿文的一些分享,有几个心得非常值得沉淀。
1)提示词的关键不在华丽,在于明确主体、场景、音效与镜头信息。
- 主体:直接指定参考图,用一个固定名称贯穿整个剧本;
- 场景:一张场景参考图足矣;
- 音乐:务必注明“不要生成任何背景音乐,只生成环境音效”,否则后期剪辑会非常头疼;
- 镜头:时间戳按需添加,但镜号必须清晰,比如镜头01、02,便于前后衔接。
提示词的结构可以参照海辛提供的成熟模板。

2)不要盲目追求分辨率。目前 720P 对提示词的遵循度最高,1080P 次之,4K 反而容易失控。
3)核心仍然是画面控制。动手前,脑中要先有清晰的分镜、画面、转场、动作、运镜和剧情细节。好的画面是讲好故事的前提。
4)你自己都不看的提示词,也别指望 AI 能生成高质量视频。
这些经验,有些可以交给工具,有些必须自己把关。像提示词结构、主体和场景的复用工作,完全可以交给 Agent 自动化;但具体的画面感、分镜节奏和情感走向,还是要创作者自己拿捏。
最近一些 AI 视频工具进一步强化了创作手感,比如内置画布模式和 Agent 加速模式,让精细控制与效率不再对立。下面以一次完整的短片制作过程,体验一下这种“双模”驱动。
实践技巧:画布与Agent双模式协作
1)画布模式:手搓细节的分镜规划
设想一个科幻短片,故事设定如下:
女孩小夏醒来后突然失语,却意外发现自己可以用意念操控身边百米内的物体。她从床上起身、出门,由此展开一场奇幻之旅。
任务:基于此设定,构思一段 90 秒的 AI 短片脚本,分为 6 段 15 秒视频,逐段设计视频提示词。
要求: 1、故事逻辑严谨,硬核科幻内核,开放性结局,引人深思。 2、共设计 6 段 15 秒视频提示词。
先新建一个空白画布。

在画布中双击即可自由创建文本、图片、视频和分镜表节点。工具会自动输出一份含提示词的脚本。

接着继续向它输入指令:
请基于这个脚本,设计出需要用到的角色和场景的文生图提示词。
然后就能用这些提示词生成人物、道具和场景图了。

在图像生成方面,主流的平台支持多种模型,比如香蕉2、 Seedream 5.0、MJ V7 和 Image2。实测下来,建议优先选择 Image2。

这里分享一个我常用的人物主体提示词:
约20岁东亚少女,齐肩微乱黑发,杏眼,鹅蛋脸,浅灰白棉质睡裙,3/4 视角半身清晰,电影级硬科幻写实,干净浅灰纯色背景只展示主体,8K,精致细节,studio 柔光。
这是穿睡衣的小夏。略作调整,就能得到出门装扮的版本。
