AI 原生组织靠技能运转:如何构建并规模化技能体系
AI-Native Organisations Run on Skills: How to Structure and Scale Them — Imad Touil, QuantumBlack

Imad Touil 认为,AI 原生组织的 know-how 应沉淀为可复用、可发现、可治理的 skills;真正难点不是创建技能,而是版本、权限、评估、可观测性与跨团队责任归属。
确定性说了三次,数据未曾露面:一场「技能决定论」演讲的质疑式复盘
2026 年 8 月 28 日(这是上传日期,录制时间可能更早,无法独立核实),YouTube 频道「AI Engineer」发布了一场约二十分钟的技术演讲,主讲人据视频元数据是伊马德·图伊尔(Imad Touil),自称是 QuantumBlack 的杰出工程师(distinguished engineer)。素材整理方特别提示:这个身份与头衔在整场转写里从未被本人亲口说出,只存在于标题元数据中。从结尾那句"有问题可以到领导力休息室(leadership lounge)找我"来看,这应是一场线下技术会议上的演讲实录。演讲题目叫《AI-Native Organisations Run on Skills》,大意是:人工智能原生组织,靠技能(skills)运转。这个断言出现在开场第一分钟,也贯穿了其后每一个论证环节。但把十五段自动转写逐段拆开,它被重复的次数,远远多过被证明的次数。本文是一场质疑式复盘:不下对错结论,只把这些话放回原处,看哪些环节咬合严密,哪些环节至今悬空。
要点速览
- 互动落差很真实,计数从未发生。 开场两次举手:创建使用过技能的手多,跨组织治理维护过技能的手少;但整个过程没有人数、没有比例,所谓"绝大多数与极少数"只是台上向台下扫了一眼的观感。
- 「10% 到 20%」是一份提前写好的自我保留。 主讲人称观众看到的只是全貌的一到两成,且各组织差异很大;而整场论证里的"全部""大多数",恰恰都建立在没有展示的那八成到九成上。
- 整个技术栈被降级,举证却只有反问。 钩子(hooks)、MCP 服务器、子代理(sub-agents)被宣布"带不来结构性价值",唯一支撑是一句"谁真的构建过大量 MCP"的口头反问。
- 时间线没有日期,基准名存疑。 Anthropic"第一篇讲技能的文章"没有日期标题,两个月后出现的标准没有名字,评测基准在转写里是 SkillsBench、素材词表疑为 SWE-bench,而"明显更高"的提升幅度始终没有数字。
- 确定性的承诺与生成式的不确定性从未对质。 监管工作流被宣布"可预期、确定性",转写里没有任何一处解释实现机制。
- 模拟参数齐整,结果只有形容词。 十五个团队、每队五到十二人、跑六个月,产出的结论却是"中等""低到中""真的非常高"这类现场观感。
- 胜利宣言与让步同段出现。 治理(governance)被说成"几乎解决"全部问题,同一段又承认部分技能"会分裂",且关键让步句的否定词疑似被转写吞掉。
- 结尾那声「那又怎样」是一把双刃剑。 主讲人用它敲打"自动进化技能"的热度泡沫,但同一个问题,也悬在他自己的整套主张上方。
<!-- digest-refs: segment-001, segment-005, segment-006, segment-008, segment-012, segment-013, segment-015 -->
【1】一场举手测试,只验出了缺口,没验出任何数字
开场不过几十秒,主讲人抛出第一个问题:已经创建并使用过技能的,请举手。转写显示,现场的手成片举起。第二个问题紧随其后:在你自己所在的组织里治理、维护过这些技能的,手请不要放下。手放了下去,大片地。主讲人的判词很轻:"I see a few hands."——我看到的只有零星几只手。
于是这场演讲的主题被当场制造出来:会建会用的人遍地,会管会养的人罕见。必须承认,这个反差大概率是真的,它与大多数从业者的日常感受吻合。但它不是一次测量。整场互动没有点人数,没有算比例,没有留档,所谓"大多数"与"极少数"靠的只是一束投向观众席的目光。严格讲,这是一次气氛测量,而非一次调查;它的功能是制造落差,而不是提供数据。
更要命的是,这场演讲稍后在另一处自己拆了自己的台。讲到技术栈全景时,主讲人忽然坦白,观众此刻从屏幕上看到的,"literally, like, probably 10%, 20% of what is it"——很可能只是全部内容的一到两成,而且组织之间的差异还很大。一到两成是估的,差异很大是补的。一个以"组织靠技能运转"为题的演讲,等于当场承认自己的要点只露出一个边角。那么问题就摆在桌面上:那些用来支撑结论的"大多数人""几乎没有""全部诀窍",其基数究竟藏在那没被展示的八成到九成里的哪一处?开场那句定调 "AI native organizations runs on skills",连主谓单复数都没对齐(按语法应为 run,转写如此,未必是原话),却要以满场手的起落为证。证据与断言之间的位差,从第一分钟就开始了。
<!-- digest-refs: segment-001, segment-005 -->
【2】被降级的技术栈,与被独尊的一层
主讲人给了两幅图景。第一幅是所谓智能体(agent)软件栈的两个循环:内循环是代码与智能体,其核心组件按转写是上下文管理器(context manager)、工具与 MCP(模型上下文协议,Model Context Protocol,简称 MCP)、记忆与状态(memories and states)、技能;外循环是工作流(workflow),工作流里装着技能、子代理、MCP 服务器与钩子;底下还有一层"使能组件"(enablement components),包括环境沙盒(sandbox)与一个 MCP 网关。一个容易被忽略的细节是:在主讲人自己画的图里,技能出现了两次——内循环的核心组件里有它,外循环的工作流里还有它。全场最轴心的那个词,恰好是唯一把两层串起来的那根线,这大概也解释了,他为什么愿意在开场那场举手游戏上花掉整整一分钟。第二幅更恢弘:模型网关(model gateway)、知识图谱(knowledge graph)、工作流市场(workflow marketplace)、上下文层(context layer),上下走完一个软件交付生命周期(software delivery lifecycle)——定义、规划、拆解、实现四步。模型网关负责统一管理组织里全部大语言模型,既包括可以本地运行的开源模型,也包括前沿模型(frontier models),一个厂商都没点名;上下文层则负责把完成任务所需的一切汇集到一起,他拆成四样:项目指令(project instruction),用开发者仓库里熟悉的 CLAUDE.md、AGENTS.md 两个文件来类比;工具与 MCP schema,作用是搞清楚何时该用哪个工具;记忆,即与最终用户的对话历史,用他的说法是"人在环中"(human in the loop);以及检索来的内容,可以从文件、代码库等处拉取。他说,这套四步"当今大多数编码代理(coding agents)差不多都是这么被塑造出来的"。这是一句市场判断,转写里没有任何出处。
真正值得注意的是随后连续发生的两次"降级"。第一次,他说这套内外双循环"在组织的复杂度下根本不是这么组合的"——"In reality, that is not how it is composed at scale"——它只是完整生命周期里的一个产品增量(product increment)步骤;真正端到端的旅程还要经过产品策略、成功指标、路线图、市场研究、竞争分析、客户访谈、问题陈述、方案验证、实验与用户故事,以及数据准备与平台工程运维(platform engineering ops)。第二次降级发生在回到技术栈之后:工作流的四个核心组件里,钩子只是"沿流程触发事件",子代理只是"压缩上下文窗口(context window)",至于 MCP 服务器——"who actually built a lot of MCPs?"——谁真的构建过大量 MCP?他反问。他自答:大家只是用着既有工具自带的 MCP 工具,并不真正拥有它们。于是结论顺流而下:"all of your know-how is actually at the skills level"——归根到底,所有诀窍都沉淀在技能这一层。他随即补了一句带警告的定调:"if you don't have the right structure of your skills, then you're not really having a deterministic workflow"——如果你的技能没有正确的结构,你就谈不上真正拥有一个确定性的工作流。结构对了才谈得上确定性,可这个"结构"长什么样,转写里暂时没有下文。
这套推理每一步都走得很快,却没有一步带着证据。钩子"带不来结构性价值"是断言;"没人真正构建过 MCP"是在用提问代替普查——对象是谁、样本多大,均未给出。更微妙的是术语本身:转写里内循环被称作 "the code and agents harness",素材方标注 harness(编排框架)一词可能是听错,也可能是口误;连这幅图的基石名词都处在未定状态。至于"过去十八年职业生涯里,每个组织都散布着多个开发生命周期"(转写作 DLC,词表疑为软件开发生命周期 SDLC)——"For the past 18 years in my career"——十八年这个自述数字同样无法核实,他服务过哪些组织,一个名字都没有。把一切压到"技能"身上的那杆秤,恰好是全场最缺砝码的一杆。
<!-- digest-refs: segment-001, segment-002, segment-003, segment-004, segment-005 -->
【3】两个月出标准、二月已普及,却没有人名、没有日期、没有幅度
为了回答"为什么是技能",主讲人称 Anthropic 在距演讲几个月前发表了"第一篇讲技能的文章";两个月后,一个被采纳的开放标准出现了,"大量智能体编排框架开始采用这个新标准";再到"今年二月前后,大多数智能体都已经采用了它"。连起来看,一篇文章、两个月出标准、再到二月已普及——技能的采纳速度是以月计的,快得几乎没有发出声音。他还附了一条现场观察:智能体拉取技能的动作发生在它的"思考"过程里,肉眼看不见,但只要盯住思考轨迹,就能看到它边跑边拉。这条曲线之所以悄无声息,正是因为它躲在推理过程内部;可反过来讲,曲线走得越安静,它就越需要那几个没被说出口的姓名与日期来作证。
这条时间线听起来干脆,可每一环都缺关键信息:文章没有日期标题,标准没有名字与发布方,"大量框架"没有点名,"今年"是哪一年转写没给——若按上传日期 2026 年 8 月倒推,今年二月大约指 2026 年 2 月,但录制时间本身未知,这层推算也就跟着悬空。然后是他自称的"快照":他在一些公开 GitHub 仓库与公共注册表上统计了技能数量,结论是公开渠道与组织内部实际的创建量都"远超快照所示"。快照里到底有多少?没有数。超过多少?没有数。一张没有数字的快照,只能算一张照片。
最值得追问的是评测那段。据转写,最新版的一个评测基准(benchmark)让模型"在不使用技能的情况下执行软件工程与网络安全领域的同类任务"对比。没技能时表现不错——"because that's what it expects"——因为没技能正是模型所习惯的形态,而且还会一天天进步;挂上"更具确定性的技能"之后,"结果明显高于不用技能的基线"。高多少?没有数。更蹊跷的是基准的名字:转写里写作 SkillsBench,而素材分析包自带的词表把它订正为 SWE-bench,把 "autoengineering" 订正为 "software engineering"。订正本身未经核实,但它与转写的出入恰好构成一条可追踪线索——顺着这两个名字去查,就能知道台上引用的究竟是哪个基准、什么规模的对照。把一个"明显更高"的对比讲完全程,却既不给基准一个确切的字,也不给提升一个具体的数,这段论证的承重墙其实是悬空的。
<!-- digest-refs: segment-006 -->
【4】把「确定性」挂在监管流程上:凭什么?
转到"技能该怎么设计",主讲人开出的是一张全对的清单:可复用、模块化、可被发现、专门做一件事而不要做成新的单体、可组合以避免重复与运行时冲突、一致与确定、成本高效,还要对付上下文窗口的容量——办法是渐进披露(progressive disclosure):在正确的时间放进正确的技能、正确的数量,去解决正确的问题。可移植性则用一个亮眼的承诺收尾:在 Claude Code 上写好的技能搬到 Cursor,"it's going to just work",直接就能用。这句话没有给出标准名称,也没有给机制,只有"遵循同一标准"——而那个标准,上一个章节里同样没有名字。
真正的重头戏是监管案例。一张被说成"非常简单"的幻灯片:数据保留政策(data retention policy)技能。他强调,涉及监管时,必须理解并明确指示智能体在何时、如何操作客户数据(转写里是 why,按词义疑为 when 或 how),确保数据"按法规被处理"。监管层面的可组合技能要覆盖四类:数据保留政策、披露标准、《通用数据保护条例》(GDPR)规则、申报模板。他说,这些技能由"监管披露审核工作流"在运行时自动拉取,于是——"the outcome is expected. It's deterministic."——结果是可预期的,是确定性的;还能产出"一个真的可以存储下来的审计报告",并精确标出待改进之处,回环改进代码库。
至少有三处需要较真。其一,四类清单如何撑起"不管是在网页、移动端还是其他应用里构建的任何数据、任何功能都遵守这些规则"的总体性宣称?概括的口径远大于清单的长度。其二,"确定性"被安在一个运行大语言模型(large language model,简称 LLM)的工作流上,转写里没有任何一处解释机制:是固定规则路径,是代码兜底,还是纯靠提示约束?生成式系统的不确定性与"确定性产出"的承诺之间,本应有一场正面对质,现场没有发生。其三,演示的前提本身就飘着——技能目录、编排框架、输出各落在幻灯片哪一边,主讲人当场的左右指认前后不一致,素材方标注需对照画面才能确认。连演示的物理布局都要靠猜,其上的确定性结论自然要多打一个问号。段末那句 "However, if we don't govern skills," 戛然而止——转折之后的恐惧,被留给了下一段。
<!-- digest-refs: segment-007, segment-008 -->
【5】十五个团队、六个月:参数齐了,数据没露面
"治理缺位"的后果被讲成一连串必然:同样技术栈的团队"必然"重复建设而不共享;技能验证不跟最新模型对齐,"质量就会随着时间退化";没有治理,"你根本无法发现技能"。解法借的是微服务(microservices)时代的旧机器——内部开发者平台(Internal Developer Platform,简称 IDP)如 Backstage 让"接入服务目录(service catalog)就能立刻查到微服务归谁所有",技能也需要同样的注册、归属与领域驱动设计(domain-driven design,简称 DDD)式的目录塑形;在此之上还要安全流水线防提示注入(prompt injection)、访问控制(access control)防敏感业务逻辑外泄,然后从个人层、团队层一路走到集中式平台:可搜索、带元数据(metadata)的目录,命令行(command-line interface,简称 CLI)拉取,依赖关系,版本与生命周期,访问控制,评估与可观测性(observability)。最后落到那句转折:"And this is where technology stops solving the problem"——技术到此为止。接下来该由架构师、工程负责人、基础设施负责人、网络安全负责人"真正坐下来",各自认领一部分领域。
检验这套机器的是他自称的模拟:十五个团队,每队五到十二人,连续跑六个月,跟踪人均创建技能数、技能平均利用率、每日拉取数、重复率、质量与安全比率。参数交代得整整齐齐,结论却全部落在形容词上。他随机点开两个团队看板:第一个,"生产力大概是中等"(原话 medium);第二个,生产力"低到中"、质量与安全"中等",唯独成本,"it's really high",真的非常高。没有任何一个具体数值从口播里掉出来。随后他说,如果对全部技能实行统一治理,"当然,其中一些会分裂"——"some of them will split... And this is reality"——分裂到底指什么,转写没有解释。紧接着是一句孤立而突兀的 "perfect as we expect",素材方提示这里疑似漏掉了否定词 not:原话可能是"并不总像我们期待的那么完美"。一个否定词的有无,直接决定这句是让步还是夸口——而转写恰好在这里断了。再往后,治理机制被浓缩成一个魔法时刻:发布一个技能,下一位工程师要建新技能时,编码代理的编排框架会自动识别已存在的那一个并直接拉取复用——"you almost solve all of the issues that I covered about governance",几乎解决了所有问题。
"几乎解决"四个字,"几乎"和"解决"都必须保留,哪一个都不该被吞掉。何况紧接着主讲人自己就收窄了战线:技能"只是工作流的一个组件",搞懂技能不等于万事大吉。十五个团队的模拟没有给出可复算的数字,随机看板的口播评级没有给出打分标准,治理的"桌子"点了四个角色的名,却没说清是谁把大家叫到桌边——毕竟那张桌子,按他自己的说法,正站在"技术停止解决问题"的边界线上。
<!-- digest-refs: segment-009, segment-010, segment-011, segment-012, segment-013 -->
【6】「几个月后市场上见」,与结尾那声「那又怎样」
收尾两段把镜头推向未来。集中式平台被描述成工作流与技能共同的归宿:后来的工程师可以接入既有工作流,补齐所需技能,跑通测试,把改进推回平台供全组织复用;"this is just the start",这一切只是起点,现阶段跨度是六到八个月。下一个方向是技能注册表(skills registry):"你们应该有一个,如果还没有的话";他还预告了一个好消息——"过去所有解决 IDP 问题的厂商,已经在开始把这项能力集中化","也许再过几个月你就会看到它出现",而且"市面上已经有很多工具在做这件事"。厂商是谁?"所有"。工具是哪些?"很多"。一个名字都没有。接着他承认,技能评估(skills evaluation)"仍然是一个开放讨论",业界没有公认的正确方法;他自己觉得"最省事又管用"的,是把静态测试(static tests)挂上去,或者对照 Anthropic 的最佳实践来评。
然后到了全文最锋利也最耐人寻味的一分钟。清单的最后一项是"自动进化"(auto-evolving):让技能自己演化——"这是当下所有人追捧的下一个热度。"他模仿了一段宣称:"是啊,我可以搭一个闭环(closed loop),让我的技能自动进化。"随即反问一句:"So what, right?"——那又怎样呢?如果没设好护栏(guardrails)就自动启动这台机器,"影响会远比今天大";而没有治理,你做的不过是在维护自动进化的技能。讲完,他致谢收尾,邀请大家到"领导力休息室"找他提问。
这声"那又怎样"值得琢磨。它当然敲得响:技术能力不会替组织做治理决定,追热点的自动进化尤其该被审问。但同一个反问是可以掉头的——技能标准两个月普及的叙事没有名字,技能数量的快照没有数字,评测的提升没有幅度,模拟的产出没有数值,预测的厂商没有名单。对这些,"那又怎样"的正确答案、被追问的下半场,恰恰发生在转写止步的地方:那间"领导力休息室"。转写没有记下任何一条提问。整场演讲在最有意思的一刻进入了沉默。
<!-- digest-refs: segment-014, segment-015 -->
代表性短摘与中文转述
- "AI native organizations runs on skills." —— 中文转述:人工智能原生组织,靠技能运转。定调句;转写里 runs 与 organizations 单复数不对齐,按语法疑为 run。
- "In reality, that is not how it is composed at scale, when you look at the organization complexity." —— 中文转述:现实里,一旦把组织的复杂度算进来,它根本不是这样组合起来的。
- "The MCP servers, we all know that you made it in an MCP tool, but tell me, who actually built a lot of MCPs?" —— 中文转述:MCP 服务器嘛,我们都知道你用得上 MCP 工具,可你告诉我,谁真的构建过大量 MCP?原文句法断裂,素材方标注为疑似口误或转写误差,中文按语意补全。
- "if you don't have the right structure of your skills, then you're not really having a deterministic workflow" —— 中文转述:如果你的技能没有正确的结构,你就谈不上真正拥有一个确定性的工作流。
- "if I'm having a skill on Claude Code and I want to move it to Cursor, it's going to just work" —— 中文转述:只要遵循同一标准,我在 Claude Code 上写好一个技能,想搬到 Cursor 就能直接跑。这是全场关于可移植性的招牌承诺,标准名称与机制均未给出。
- "This defines a new unit that makes your know-how in your organization executable, portable" —— 中文转述:这定义了一个新单元,让你组织里的诀窍变得可执行、可移植。句子在 portable 处被截断,后半句缺失。
- "the outcome is expected. It's deterministic." —— 中文转述:结果是可预期的,是确定性的。
- "if we don't have a skill someone is vibe coding back and forth and trying to figure out exactly how to steer the agent to implement it properly" —— 中文转述:没有技能的话,就有人在那里"氛围式编程"(vibe coding,指不靠明确技能、反复试错地引导智能体),来回折腾,琢磨怎么把智能体引导到正确实现。
- "So what, right?" —— 中文转述:那又怎样呢?
<!-- digest-refs: segment-001, segment-003, segment-005, segment-007, segment-008, segment-012, segment-015 -->
注
- 本稿的全部素材来自自动生成字幕(whisper)转写及其分析包;字幕未经人工校对,标点、断句、时间码与实际发言之间可能存在偏差。正文中凡标注"转写如此""疑似""素材方提示"之处,均为对转写不确定性的保留。
- 主讲人姓名(伊马德·图伊尔)、所属机构(QuantumBlack)、频道(AI Engineer)与上传日期(2026 年 8 月 28 日)均来自视频元数据;本场转写中主讲人未自报姓名与头衔,录制时间可能早于上传日期,以上信息均未经外部核验。
- 素材分析包词表给出的若干订正——SkillsBench 疑为 SWE-bench、autoengineering 疑为 software engineering、DLCs 疑为 SDLCs 等——同样未经核实,仅作为可追踪线索列出,读者可据此自行查证。
- 文中"转写显示""自称""据元数据"等限定语表示相应说法仅见于素材、尚无独立证据,一律按不确定状态处理,不写作既成事实。
最后
离开讲台的是讲述者,留下的是一套修辞上完整、证据上悬空的主张。把这面镜子举起来照一照,有几处反射比内容本身更清楚。
第一,数字感与证据完全不成比例。全场真正站得住的硬数字屈指可数,报一下名:十八年职业资历、十五个团队、每队五到十二人、六个月模拟、屏幕上的一成到两成、现阶段六到八个月、两个月出标准。而论证链条上最吃力的三个环节——确定性技能带来的提升幅度、渐进披露省下的词元数量、跨团队重复建设的规模——统统没有数值。举手互动缺数字,看板评级缺数字,模拟结果缺数字;反倒是断言在一路升级:从"技能是关键组件之一",到"所有诀窍都沉淀在技能层",再到"几乎解决全部治理问题",全程在形容词轨道上完成。一个主张被说得越肯定,证据义务就越大;这场演讲恰好反着来——连全篇唯一主动给出的覆盖面数字"一成到两成",本身也是一句没有量过的估计。
第二,"确定性"的口径问题。这个词在转写里至少出现三次——确定性工作流、一致与确定、结果可预期且确定——但每一次它对面的"生成式不确定性"都被礼貌地略过。承诺确定性的流程运行在本身不承诺确定性的模型上,这是技能叙事最该回答、却始终没有回答的问题。
第三,文本自身的不稳定。关键让步句 "perfect as we expect" 疑似丢了否定词,"会分裂"没有解释,"为什么操作客户数据"疑为"何时或如何"——论证走到最要紧的几个岔口时,脚下的自动转写恰好都在打滑。这不只是技术瑕疵:当一套"治理"叙事连自己的底稿都给不出稳定版本,它承诺给别人的确定性,就更加可疑。
第四,可追踪信号其实不少,只是没人顺着追踪。Anthropic 那篇"第一篇关于技能的文章"可以查;两个月后的开放标准可以查;SkillsBench 与 SWE-bench 两个名字可以查;"今年二月"与上传日期的时差可以算;领导力休息室里的问答没有转录,但它的缺席本身就是一个信号。一个把"可追踪、可审计"挂在嘴边的演讲,值得被这些线索追踪一遍——而追踪的结果,将决定这场演讲是开荒,还是预热。
最后也是最深的一层:他用"那又怎样"审问自动进化的热度,这种审问姿态本身是对的。但同一把尺子量回他自身,就量出了缝隙。如果技能只是工作流的"一个组件",那套以技能为唯一主角的治理方案,是不是也在放大自己的分量?如果治理最终要靠架构师、工程负责人、基础设施负责人、网络安全负责人"坐下来",那个没人认领的"谁把大家叫到桌边",恰恰是"技术停止解决问题"之后真正难的部分。演讲在那里停了。追问不必停在同一个地方。