073 · 思维模型

单环学习 / 双环学习

区分优化动作和重审目标、客户、假设、瓶颈

分类:企业拿单操作系统补充模型(去重新增)
单环学习 / 双环学习视觉图

① 是什么

一句话定义

学习发生在发现并纠正“意图与结果的偏差”时。单环学习在既定目标、价值观和规则不变的前提下调整行动;双环学习则进一步检查并修改支配行动的目标、价值观、规则和假设,然后再改变行动。

理论来源与核心身份

单环学习与双环学习源于克里斯·阿吉里斯(Chris Argyris)和唐纳德·舍恩(Donald A. Schön)的行动理论与组织学习研究。1974 年两人合著《Theory in Practice》,1976 年阿吉里斯发表《Single-Loop and Double-Loop Models in Research on Decision Making》,1977 年又在《哈佛商业评论》发表《Double Loop Learning in Organizations》,将它进一步用于组织管理。

最准确的归属是:阿吉里斯与舍恩共同提出并发展,阿吉里斯是主要系统化和传播者。

本模型首先是一张组织与行动学习母卡。下文的经营复盘和个人认知更新,是本库为了真实任务做的应用翻译,不冒充原著逐字表述。

它解决什么问题

  • 同类问题反复出现,团队每次都加动作,却没有检查目标、政策和假设。
  • 执行越来越熟练,最终结果却没有改善,甚至越努力越偏。
  • 组织嘴上鼓励坦诚,实际却惩罚坏消息,导致真实问题进不了决策层。
  • 过去成功经验已经失效,但个人或团队把旧方法当成身份,不愿接受反证。
  • 复盘停留在“谁没做好”,没有检查指标、激励、客户选择和价值主张是否制造了问题。
  • 需要判断一次反馈究竟应该进入动作优化,还是进入目标与底层假设重审。

企业最危险的不是不努力,而是高效率执行错误假设。单环学习让系统越来越熟练,双环学习防止系统越跑越偏。

核心结构

阿吉里斯与舍恩把行动学习理解为“支配变量—行动策略—现实结果”的反馈系统:

flowchart LR
    A["支配变量:目标、价值观、规则、假设"] --> B["行动策略"]
    B --> C["现实结果"]
    C --> D["意图与结果的偏差"]
    D -->|"单环:目标和规则不变,只改行动"| B
    D -->|"双环:检查并修改支配变量"| A

三个关键概念:

概念 大白话 例子
支配变量 真正控制选择的目标、价值观、规则和假设 “销售必须多拜访”“坏消息不能上报”“客户一定看重低价”
宣称理论 我们嘴上说自己遵守什么 “我们鼓励坦诚和创新”
使用理论 真实行动暴露出我们实际上遵守什么 报坏消息的人被批评,团队于是只报喜

双环学习真正困难的地方,通常不是想不到新方法,而是修改支配变量会触碰身份、权力、既得利益和组织防御惯例。

单环、双环与再学习

学习层级 核心问题 典型动作 适用条件
单环学习 怎样更接近既定目标? 改流程、话术、节奏、人员和资源配置 目标、规则和关键假设已有足够证据
双环学习 目标、规则和关键假设本身对吗? 重审目标、政策、客户、指标、价值观和约束判断 动作基本到位但偏差反复出现,或出现强反证
再学习 / 学会如何学习 我们怎样发现、讨论并纠正错误? 改反馈渠道、复盘机制、信息透明度和坏消息保护规则 组织连真实问题都无法进入讨论

这里的“再学习”(deutero-learning)是观察和改进学习机制本身,不把它简单包装成流行说法中的“三环学习”。

交付物

  • 结果偏差与证据表。
  • 动作证据 / 假设证据分流表。
  • 支配变量审计表。
  • 宣称理论 / 使用理论对照表。
  • 动作复盘表。
  • 假设复盘表。
  • 单环优化清单。
  • 双环重审结论。
  • 反证、切换条件与下一轮最小实验。

来源与证据状态

  • 经典来源:Chris Argyris、Donald A. Schön,Theory in Practice: Increasing Professional Effectiveness,1974。
  • 关键论文:Chris Argyris,Single-Loop and Double-Loop Models in Research on Decision Making,1976,DOI:10.2307/2391848
  • 组织应用:Chris Argyris,Double Loop Learning in Organizations,《Harvard Business Review》,1977。
  • 认识论身份:成熟的组织与行动学习理论框架,不是保证组织一定学会改变的因果定律。
  • 本库适配:经营复盘和个人认知更新属于应用翻译;经典理论与应用层在卡片中明确分开。
  • 当前证据状态:经典框架来源E1;本库“双应用层”的跨场景现实效果待继续验证。
  • 参考入口:https://books.google.com/books/about/Theory_in_practice.html?id=qmFHAAAAMAAJhttps://doi.org/10.2307/2391848https://hbr.org/1977/09/double-loop-learning-in-organizations

② 适用范围

适合解决的问题

经营反馈机制

什么时候适合用

  • 修动作还是修假设
  • 动作越做越熟但结果不改善
  • 反复改动作仍无效
  • 团队只加码执行不检查目标
  • 检查成功标准
  • 经营反馈机制
  • 过去成功经验与新现实冲突
  • 重审价值主张
  • 问题定义与情境判断系统

不适用时

  • 如果问题更适合 系统思考,不要只因关键词相似调用本模型。边界:系统思考解释系统结构如何生成行为模式;单环 / 双环学习判断现实反馈应当修正行动,还是重审目标、规则、价值观和关键假设。
  • 如果问题更适合 PDCA,不要只因关键词相似调用本模型。边界:单环学习 / 双环学习判断反馈应修正行动还是重审目标、规则和假设;PDCA在目标与规则基本成立时持续计划、执行、检查和改进。
  • 如果问题更适合 OODA,不要只因关键词相似调用本模型。边界:单环学习 / 双环学习区分修动作还是修支配变量;OODA强调在变化环境中更快观察、判断、决策和行动。
  • 如果问题更适合 心理免疫模型,不要只因关键词相似调用本模型。边界:单环学习 / 双环学习识别行动背后的目标、规则和假设是否需要修改;心理免疫模型解释人为什么即使知道要改,仍被隐藏承诺、恐惧和大假设拉回原状。
  • 如果问题更适合 第二序列改变,不要只因关键词相似调用本模型。边界:单环学习 / 双环学习是反馈学习框架,区分在既有规则内纠错和修改支配变量;第二序列改变更广泛地解释改变规则、关系和系统结构本身。
  • 如果问题更适合 智能复利假说,不要只因关键词相似调用本模型。边界:单环学习 / 双环学习区分反馈是修动作还是修目标与假设;智能复利假说检查任务、结果、持久写回、跨任务迁移和任务升级的完整增强回路。

易混淆模型区别

系统思考 × 单环学习 / 双环学习
系统思考解释系统结构如何生成行为模式;单环 / 双环学习判断现实反馈应当修正行动,还是重审目标、规则、价值观和关键假设。
要看反馈、延迟、存量流量和结构副作用时选系统思考;要判断这次反馈究竟修动作还是修支配变量时选单环 / 双环学习。

单环学习 / 双环学习 × PDCA
单环学习 / 双环学习判断反馈应修正行动还是重审目标、规则和假设;PDCA在目标与规则基本成立时持续计划、执行、检查和改进。
反复改动作仍无效、需要检查支配变量时选单环学习 / 双环学习;目标已验证、只需稳定执行迭代时选PDCA。

单环学习 / 双环学习 × OODA
单环学习 / 双环学习区分修动作还是修支配变量;OODA强调在变化环境中更快观察、判断、决策和行动。
需要重审目标和假设时选单环学习 / 双环学习;方向基本正确但环境快速变化、需要缩短决策周期时选OODA。

单环学习 / 双环学习 × 心理免疫模型
单环学习 / 双环学习识别行动背后的目标、规则和假设是否需要修改;心理免疫模型解释人为什么即使知道要改,仍被隐藏承诺、恐惧和大假设拉回原状。
先判断应该改动作还是改假设,选单环学习 / 双环学习;已经知道该改什么但长期做不到,选心理免疫模型。

单环学习 / 双环学习 × 第二序列改变
单环学习 / 双环学习是反馈学习框架,区分在既有规则内纠错和修改支配变量;第二序列改变更广泛地解释改变规则、关系和系统结构本身。
复盘反馈该改行动还是假设,选单环学习 / 双环学习;需要设计系统规则和关系结构的层级跃迁,选第二序列改变。

智能复利假说 × 单环学习 / 双环学习
单环学习 / 双环学习区分反馈是修动作还是修目标与假设;智能复利假说检查任务、结果、持久写回、跨任务迁移和任务升级的完整增强回路。
只需判断这次反馈改动作还是改假设,选单环学习 / 双环学习;要判断学习是否沉淀成可继承能力并承接更难任务,选智能复利假说。

它不解决什么问题

  • 不直接告诉你新的目标、客户、价值主张或政策应该是什么;它先帮助判断该修动作还是修支配变量。
  • 不意味着结果不好就推翻战略。动作没有按标准执行、样本不足或反馈周期未到时,先做单环纠偏。
  • 不替代 PDCA / OODA;目标和规则基本成立时,执行迭代优先使用 PDCA 或 OODA。
  • 不替代心理免疫、行为设计或心理治疗;已经知道该改什么但长期做不到,需要另查恐惧、隐藏承诺和行为条件。
  • 不把所有批评、失败或年龄问题解释成“认知僵化”;外部歧视、健康、资源、权力和制度约束需要单独处理。
  • 不允许用“重审假设”逃避钱款、合规、交付、健康或关系修复责任。

适用问题对象

  • 企业和团队的经营复盘、战略假设重审与组织学习。
  • 课程、咨询、产品和项目中反复出现的同类结果偏差。
  • 指标、激励、汇报机制导致坏消息被过滤的组织场景。
  • 过去成功经验失效,需要区分修方法还是修旧观念的个人选择。
  • AI、Agent 或知识库纠错后,需要判断修改提示词、流程,还是重审目标和评价标准;若还要检查持久写回与跨任务迁移,再转智能复利假说。

诊断问题

  • 我们原本想得到什么结果,实际发生了什么,证据和反馈时滞是什么?
  • 当前动作是否真的按既定标准执行,还是把执行缺口误判成战略错误?
  • 如果动作基本到位,哪些结果偏差仍在反复出现?
  • 哪些目标、政策、指标、价值观或假设正在支配当前行动?
  • 我们嘴上宣称的原则,与奖励、惩罚、预算和真实选择一致吗?
  • 哪些坏消息、反对意见或失败证据进入不了决策层,为什么?
  • 过去有效的做法依赖哪些条件;这些条件今天还存在吗?
  • 什么证据足以让我们修改目标、客户、价值主张或主约束判断?
  • 如果关键假设被推翻,下一轮最小实验是什么?
  • 如何保护提出反证的人,避免组织重新回到报喜不报忧?

易混淆模型

  • PDCA:PDCA在目标与规则基本成立时持续计划、执行、检查和改进;双环学习先判断反馈是否要求修改目标、规则和假设。
  • OODA:OODA强调在变化环境中缩短观察、判断、决策和行动周期;双环学习强调是否需要重审支配行动的变量。
  • 第二序列改变:第二序列改变更广泛地解释改变规则、关系和系统结构本身;双环学习是围绕结果偏差展开的反馈学习框架。
  • 心理免疫模型:心理免疫解释为什么人即使知道要改,仍被隐藏承诺、恐惧和大假设拉回原状;双环学习先判断应该改动作还是改假设。
  • 智能复利假说:双环学习区分反馈是修动作还是修目标与假设;智能复利假说检查任务、结果、持久写回、跨任务迁移和任务升级的完整增强回路。
  • 无免费午餐定理:无免费午餐定理在选择或迁移模型前审计适用边界;双环学习根据行动后的现实反馈重审当前支配变量。

可替代模型

  • 目标和规则已经验证,只需持续优化执行:PDCA、OODA。
  • 不知道问题属于清晰、繁杂、复杂还是混乱域:Cynefin 肯尼芬矩阵。
  • 需要审计模型适用边界而不是复盘行动反馈:无免费午餐定理。
  • 已经知道该改什么,但因恐惧、身份和隐藏承诺长期做不到:心理免疫模型。
  • 需要检查学习是否写回系统并迁移到下一任务:智能复利假说。
  • 需要改变系统规则、关系结构和互动模式:第二序列改变、系统思考。

正例问题

  • “销售团队不断增加拜访和修改话术,业绩仍未改善,是继续优化执行,还是应该重审客户和价值主张?”
  • “公司嘴上鼓励坦诚,但每次报坏消息的人都会被批评,为什么同类风险一直暴雷?”
  • “过去成功经验已经与新现实冲突,我应该继续改方法,还是检查旧观念和成功标准?”
  • “课程每次都加内容,学员仍然不会用,问题是讲得不够多,还是课程目标和学习假设错了?”

反例问题

  • “目标和规则已经验证,只是执行节奏不稳定,如何持续改进?”优先使用 PDCA 或 OODA。
  • “知识库调用很多,但下一次判断没有更准,写回和跨任务迁移断在哪里?”优先使用智能复利假说。
  • “我已经知道应该授权,但一到关键时刻就害怕失控、重新收权,怎么办?”优先使用心理免疫模型。
  • “现场系统正在失控,应该先做什么?”先用 Cynefin 混乱域逻辑止血,不先开展完整双环复盘。

常见误用

  • 把单环学习说成低级、无用;稳定系统的大量日常改进本来就应该使用单环学习。
  • 一有坏结果就宣布目标和战略错误,跳过动作、样本和反馈时滞检查。
  • 把“双环”理解成多复盘一次,却没有识别和修改任何支配变量。
  • 只挑战别人的假设,不允许自己的目标、指标和权力安排被检验。
  • 把个人认知更新包装成“都是你观念不对”,忽略歧视、健康、资源和制度约束。
  • 用重审目标逃避交付、合规、钱款或关系责任。
  • 形成了漂亮的新解释,却没有下一轮行动、反证和结果反馈。

③ 怎么用

标准使用流程

第一步,写清结果偏差。 分别写出原本意图、实际结果、可观察证据和反馈时滞,不先归咎个人态度。

第二步,先做单环检查。 核对动作是否执行、标准是否清楚、资源是否到位、样本是否足够;动作根本没做到时,不急着推翻战略。

第三步,识别支配变量。 追问“我们必须相信什么,才会持续采取这些行动”,列出目标、客户、价值主张、政策、指标、成功尺度和主约束假设。

第四步,对照宣称理论与使用理论。 比较“嘴上说重视什么”和“奖励、惩罚、预算、时间与真实选择体现了什么”,找出组织防御和身份保护。

第五步,形成双环重审结论。 只修改被证据挑战的关键支配变量,写清继续、调整、停止或重画边界的判断,并预设反证和切换条件。

第六步,用下一轮行动验证。 把新假设变成一个小实验,观察结果是否改善;若只形成漂亮解释而没有新行动和证据,不算完成双环学习。

经营复盘应用

在经营场景中,把“支配变量”翻译成五类可检查对象:

层级 单环问题 双环问题
目标 怎样更快达成目标? 这个目标是否代表真实客户价值和经营结果?
客户 怎样触达更多客户? 我们是否选错客户或购买场景?
价值主张 怎样把方案讲得更好? 客户是否真的需要、相信并愿意为此付费?
瓶颈 怎样加大当前环节投入? 当前限制总产出的变量是否判断错了?
指标与激励 怎样提高指标? 指标是否正在诱导隐瞒、短期化或局部最优?

经营复盘不能一上来就说“战略错了”。先完成动作证据和假设证据分流:动作没有做到,进入单环优化;动作已经做到但结果偏差稳定存在,才进入双环重审。

个人认知更新应用

在个人场景中,把“支配变量”翻译成信念、身份和成功尺度:

flowchart LR
    A["过去成功"] --> B["旧经验变成身份"]
    B --> C["防御反对意见"]
    C -->|"减少"| D["接触现实反馈"]
    D --> E["认知更新"]
    E -->|"减少"| F["与现实的错配"]

个人双环学习可以问:

  • 这个观点当初在什么条件下成立?
  • 哪些条件已经变化?
  • 我是在保护一个有效原则,还是保护“我过去是对的”这个身份?
  • 什么证据会让我修改看法?
  • 未来 24—48 小时能做什么小实验?

年龄增长、能力变化或角色错配可以是事实;“我整个人没用了”不是双环学习结论,而是把局部结果升级成身份审判。

+1 秒懂案例

秒懂案例:原文未提供。