# 自适应学习中「人–AI」二元体的相干性：最近发展区作为控制参数的内部最优

> 将ODTOE应用于AI辅助学习：学习者与AI导师作为一个相干二元体，收敛到能力不动点。难度存在内部最优——最近发展区与心流的交集。相干性 B = F·E·(1−σ)·Λ（弱环节）；令人信服的掌握表象即「理想误差」。

Source: https://odtoe.org/zh/articles/human-ai-learning-coherence
Author: Anton Pankratov · Observer-Dependent Theory of Everything (ODTOE) · CC BY 4.0

---

人机学习二元组的相干性与自适应学习：近侧发展区作为控制参数的内部最优 A. S. Pankratov 观察者依赖的万物理论 ODTOE（观察者依赖的万物理论）方法论学家；Yoo 基金会创始人，俄罗斯喀山 ORCID: 0009-0002-4870-2995

摘要 本文将学习者与 AI 导师构成的二元组视为单一相干学习系统。学习者状态记为 Ψ，目标能力记为 Ψ∗，学习被理解为向自洽不动点的收敛过程。二元组的相干性由乘法锚 $B = F \cdot E \cdot (1 - \sigma) \cdot \Lambda$ 给出，具有弱环属性：任一因子归零则 $B$ 归零。所呈材料难度存在内部最优 $\rho^*$，位于近侧发展区与心流状态的交叉带内。进步通过掌握度差距的缩减来衡量。相干而令人信服的掌握外观形成理想误差 $\delta_{\mathrm{ideal}}$：高相干性提升学习者的自信，而实际掌握度则是一个独立的量。自调节学习环路（预思、执行、反思）以 AI 作为共同调节者而闭合。学习者对导师的集体依赖 $S$ 在可靠性上存在内部最优，在此最优处学习者仍保持主导地位。文中提出六个可操作化的代理指标、一张骨干–外围对应关系表，以及包含八项预测和一项假说的可证伪研究纲领。所有跨领域对应关系均作为控制参数拓扑层面的结构类比加以维系。全部数学、物理学与意识现象学均是单一原初区分行为的投射。

关键词：自适应学习，二元组相干性，人机，自我观察不动点，内部最优，近侧发展区，心流，掌握度差距，理想误差，自调节学习，ODTOE。

## 引言：人机二元组作为单一学习系统

本文将配备 AI 导师的自适应学习视为由学习者与导师构成的单一相干系统的行为。下文所发展的方法缩写为 ODTOE；在本文中，它是一个元理论框架，通过学习者作为观察者的相干性来参数化学习描述的空间。核心论点可正面陈述如下：学习者与 AI 导师构成一个相干二元组，其状态收敛于能力的自洽不动点，且存在难度的内部最优。经典的近侧发展区 [1] 提供了教学锚点：发展发生在学习者已能独立完成之事与借助支持可达之事之间的区间内。心流状态 [2] 为同一区间提供了动机锚点：当任务难度与当前技能水平匹配时，参与感得以持续。本文中每一项重要主张都附有认识论层级。**L2-INVARIANT** 标记跨领域迁移的结构性结论。**PREDICTION** 标记模型的经验可检验推论。**HYPOTHESIS** 标记在文献体系内尚开放或从邻近领域引入的命题。整个工作的组织对象是学习者自我观察的相干不动点，$\Psi^* \in \mathcal{H}$，

$$\Psi \in \mathcal{H}, \tag{1}$$

其中 Ψ 表示学习者在空间 $\mathcal{H}$ 中的当前知识状态，Ψ∗ 设定目标能力。学习者相干性的算子体系及其计量学借鉴自 ODTOE 的工程解读 [3]。**类比，而非等同。** 发展的教学区间、动机心流与控制参数算子拓扑之间的对应关系，保持在结构类比的层面：它们共有的是具有内部峰值的景观形状，而心理计量量与算子量有所不同。不动点算子 Φ 以及最优值 $\rho^*$ 的数值具有 HYPOTHESIS 的地位；此处不对诸量作等同处理。

## 学习作为向能力不动点的收敛

学习者的目标能力由自我观察的不动点设定，

$$\Psi^* = \Phi(\Psi^*) = \iota(\hat{O}_\Psi(\Psi)), \tag{2}$$

其中学习者状态与目标能力取自空间 (1)，自我观察算子 $\hat{O}_\Psi$ 描述学习者如何评估自身知识，整合算子 $\iota$ 将学习者的内部状态与学习材料的外部场及导师反馈相连接。在此解读下，学习是收敛到自洽状态的过程：学习者能做到自己能做之事，并一贯地知晓自己能做到。算子 Φ 不动点的存在性与唯一性仍是文献体系中的开放问题，维持在 HYPOTHESIS 层级 [3]。

学习二元组的相干性由四个因子的乘法锚给出，

$$B = F \cdot E \cdot (1 - \sigma) \cdot \Lambda, \tag{3}$$

其中 $F$ 表示专注度（使学习者保持在任务上），$E$ 编码动机能量，$(1-\sigma)$ 设定信心因子（内部失配低），$\Lambda$ 计及新知识与已掌握知识的整合程度。乘法形式产生弱环属性：失配 $\sigma \to 1$ 的增长驱使相干性趋于零，

$$\sigma \to 1 \Rightarrow B \to 0, \tag{4}$$

无论 $F$、$E$ 和 $\Lambda$ 如何。弱环规定了诊断优先级：恢复相干性从最小因子开始（**L2-INVARIANT**）[3]。一对一辅导的锚设定效果上界：个体与导师的一对一工作使群体平均结果相对正面教学提高约两个西格玛 [4]；AI 导师将这种一对一模式扩展到规模层面。

**类比，而非等同。** 因子 $F$、$E$、$(1-\sigma)$、$\Lambda$ 通过代理指标加以操作化（第 7 节），在可测量量的层面具有 HYPOTHESIS 地位。将相干性乘法形式从工程解读迁移至教学领域是控制参数拓扑的结构类比，心理计量量与算子量有所不同。

## 难度控制参数与内部最优 $\rho^*$

引入单一控制参数 $\rho$，作为所呈材料难度相对于学习者当前技能的归一化值。$\rho$ 作用的拓扑结构如下。当 $\rho \to 0$ 时，材料过于简单：学习者感到无聊，动机下降，进步减缓。当 $\rho \to 1$ 时，材料过于困难：学习者失去立足点，焦虑上升，二元组的相干性崩溃。在这两个边界之间存在内部最优 $\rho^*$，

$$\frac{\partial\, \mathrm{Quality}}{\partial \rho}\bigg|_{\rho = \rho^*} = 0, \quad 0 < \rho^* < 1, \tag{5}$$

在此处学习质量达到最大值。质量相对于难度的轮廓是单峰的，

$$\mathrm{Quality}(\rho) \text{ 在 } \rho^* \text{ 处单峰}. \tag{6}$$

最优 $\rho^*$ 与近侧发展区 [1] 和心流状态 [2] 的交叉带相吻合：任务设定在学习者当前独立水平之上，且借助导师支持仍可达到，从而维持参与感。AI 导师的作用是通过调整下一步的难度，使呈现内容持续保持在 $\rho^*$ 的邻域内，与单峰轮廓 (6) 相一致。内部最优的存在被确立为结构性结论（**L2-INVARIANT**）；$\rho^*$ 的具体数值取决于学习者和学科，维持在 HYPOTHESIS 层级。

**类比，而非等同。** ZPD∩Flow 区间与算子最优 $\rho^*$ 之间的对应关系是控制参数拓扑层面的结构类比：它们共有的是具有内部峰值的景观形状，而难度的心理计量尺度与算子参数 $\rho$ 是不同的量；此处不对诸量作等同处理。

## 理想误差的特征：掌握度差距与掌握外观

学习者的进步通过目标能力与实际状态之间的掌握度差距的缩减来衡量，

$$\mathrm{gap} = \|\Psi^* - \Psi\|, \tag{7}$$

学习在 gap 逐步缩小的程度上前进。本节的核心主张：高相干性的呈现提升学习者的主观自信，而实际掌握度则是一个独立的量。连贯的掌握外观与实际掌握之间的区间形成理想误差，

$$\delta_{\mathrm{ideal}} = \Psi^*_{\mathrm{coherent}} - \Psi_{\mathrm{factual}}, \tag{8}$$

其中 $\Psi^*_{\mathrm{coherent}}$ 表示相干而令人信服的"看似已掌握"，$\Psi_{\mathrm{factual}}$ 设定实际掌握度。相干性的增长提升信心，而掌握度由独立的量决定，

$$\mathrm{Coherence} \uparrow \not\Rightarrow \mathrm{Mastery} \uparrow. \tag{9}$$

学习二元组中理想误差 (8) 的来源是多方面的。流畅自信的导师讲解在学习者内心产生超前于独立复现材料能力的理解感，这与相干性和掌握度的分歧 (9) 相符。焦虑与刻板印象威胁在保留能力的同时降低观测结果，歪曲对 Ψ 的估计 [5]；这一渠道进入锚 (3) 的信心因子 $(1-\sigma)$。防范理想误差的措施在于通过测试任务上差距 (7) 的缩减来衡量进步；学习者的主观自信作为独立信号保留。将最大掌握外观与误差特征等同的做法作为 PREDICTION 加以标记（见第 9 节的 P4、P6）。

**类比，而非等同。** $\Psi^*_{\mathrm{coherent}}$ 和 $\Psi_{\mathrm{factual}}$ 作为掌握度差距的代理指标加以操作化，具有 HYPOTHESIS 地位。理想误差从相干崩溃的工程解读迁移至教学领域作为结构类比，而各量有所不同。

## 带 AI 共同调节者的自调节学习 RT-2 环路

自调节学习循环地展开于三个阶段：预思（目标设定与规划）、执行（带自我观察地完成任务）与反思（自我评估和结果归因）[6]。该环路被理解为更新学习者状态的两冲程回路，

$$\Psi_{t+1} = \mathrm{Reflect}(\mathrm{Perform}(\mathrm{Forethink}(\Psi_t))), \tag{10}$$

每一轮均缩减掌握度差距 (7)。AI 导师作为共同调节者进入环路：在预思阶段，它帮助在 $\rho^*$ 邻域内选择可达目标；在执行阶段，它提供反馈并维持专注度 $F$；在反思阶段，它支持对结果的正确归因，从而降低失配度 $\sigma$。共同调节随学习者自主性的增长而将调节职能转移给学习者：外部控制的比重下降，自我调节的比重上升。保持环路活跃被确立为结构性结论（**L2-INVARIANT**）：若缺少反思阶段，回路断裂，状态更新 (10) 失去自洽性 [6]。由此得出预测：具有闭合反思环路的二元组优于没有反思环路的二元组（**PREDICTION**，见 P5）。

**类比，而非等同。** 三个自调节阶段与两冲程算子 (10) 之间的对应关系是更新回路拓扑的结构类比；阶段心理构念与算子步骤是不同的量，此处不对诸量作等同处理（HYPOTHESIS）。

## 集体依赖与可靠性的内部最优 $S^*$

学习者对 AI 导师的依赖由集体参数 $S \in [0, 1]$ 描述，它设定委托给导师的决策比例。$S$ 的拓扑结构重复控制参数的拓扑结构。当 $S \to 0$ 时，学习者忽视可用支持，失去二元组的优势。当 $S \to 1$ 时，学习者将全部工作交给导师，停止练习技能，自身状态 Ψ 停止增长。在两端之间存在可靠性的内部最优，

$$\frac{\partial\, \mathrm{Learning}}{\partial S}\bigg|_{S = S^*} = 0, \quad 0 < S^* < 1, \tag{11}$$

在此处学习者仍是二元组的驱动者，而导师放大其工作。人类对自动化辅助工具的信任与依赖动态遵循与人机交互相同的不信任与过度信任规律 [7]：支持的不足使用与滥用均降低联合结果。可靠性内部最优的存在被确立为结构性结论（**L2-INVARIANT**）；$S^*$ 的具体值取决于学习者、任务与技能成熟度，维持在 HYPOTHESIS 层级 [7]。由此得出学习对依赖份额的单峰依赖性预测（**PREDICTION**，见 P7）：过低与过高的依赖均降低掌握度收益。

**类比，而非等同。** 依赖参数 $S$ 与算子委托控制比例在最优拓扑层面是结构类比量；其心理计量与算子内容有所不同，此处不对诸量作等同处理。

## 代理指标与不变量的操作化

模型的应用展开与理论部分保持相同的层级规范：所有指标均是 HYPOTHESIS 层级的可操作化代理指标，此处没有任何对应关系被宣告为已确立结论。六个代理指标构成二元组的最小测量回路。专注因子 $F$ 通过任务时间占比来读取。能量因子 $E$ 通过参与度和尝试坚持度来读取。信心因子 $(1-\sigma)$ 通过自我评估相对于测试结果的校准度来读取。整合因子 $\Lambda$ 通过向新任务的技能迁移来读取。难度 $\rho$ 通过当前水平的错误率来读取。掌握度差距 $\mathrm{gap}$ 通过无提示的延迟测试结果来读取。汇总见表 1。

**表 1：学习二元组的六个代理指标（可操作化代理；每个指标的地位为 HYPOTHESIS）。**

| 指标 | 操作化（代理） | 所追踪内容 | 地位 |
|---|---|---|---|
| 专注度 $F$ | 每次会话任务时间占比 | 注意力保持 | HYPOTHESIS |
| 能量 $E$ | 参与度与尝试坚持度 | 动机因子 | HYPOTHESIS |
| 信心 $(1-\sigma)$ | 自我评估相对于测试的校准度 | 内部失配 | HYPOTHESIS |
| 整合 $\Lambda$ | 向新任务的技能迁移 | 知识相干性 | HYPOTHESIS |
| 难度 $\rho$ | 当前水平的错误率 | 与 $\rho^*$ 的接近度 | HYPOTHESIS |
| 差距 $\mathrm{gap}$ | 无提示的延迟测试 | $\|\Psi^* - \Psi\|$ 的缩减 | HYPOTHESIS |

指标回路将测量与控制相连接：错误率与自我评估校准度作为与 $\rho^*$ 接近度的代理，而无提示的延迟测试作为掌握度差距 (7) 缩减的代理。此类解读原则（因子与难度的可观测代理作为二元组的控制信号）具有 **L2-INVARIANT** 地位，而具体的数值估计程序则是开放的，维持在 HYPOTHESIS 层级 [3]。

## 骨干与外围：对应关系与边界

模型将骨干（直接映射到控制参数及其拓扑的方法）与外围（对实践有价值但位于不变量形式骨干之外的方法）分离。表 2 汇集骨干对应关系，表 3 汇集外围对应关系。

**表 2：骨干对应关系：基础方法到 ODTOE 控制参数拓扑的映射。**

| 方法 | 锚点 | ODTOE 映射 |
|---|---|---|
| 心流，近侧发展区 | 任务难度 | 内部最优 $\rho^*$ |
| 自调节学习 | 反思循环 | RT-2 环路 (10) |
| 自我决定论 | 基本需求 | 锚 $B$ (3) 的形式 |
| BKT，DKT | 技能掌握 | 状态 Ψ 与差距 $\mathrm{gap}$ |
| 人对 AI 的依赖 | 对自动化的信任 | 依赖参数 $S$ (11) |
| 消除评价框架 | 刻板印象威胁 | 理想误差 $\delta_{\mathrm{ideal}}$ |

技能掌握状态映射到 Ψ 与差距 $\mathrm{gap}$，通过贝叶斯知识追踪 [8] 及其神经网络发展 [9] 实现，这些方法从学习者答题历史给出掌握度的概率估计。锚 $B$ 的形式与自我决定论相符：专注、能量与整合与自主性、能力感和关联性的基本需求相呼应 [10]。消除评价框架降低 $\sigma$ 从而收窄理想误差 [5]。提取练习通过主动回忆强化状态 Ψ [11]，但不设定难度控制参数的拓扑，因此相对于不变量骨干处于外围位置。学习分析学 [12] 为第 7 节的代理指标提供数据，但本身不具备内部最优拓扑。外围地位以 HYPOTHESIS 地位加以维持：两种方法进入二元组的应用实践，同时处于形式骨干之外。

**类比，而非等同。** 表 2 和表 3 中的所有对应关系均是控制参数拓扑层面的结构类比，而心理计量量与算子量有所不同；此处不对诸量作等同处理。

**表 3：外围方法：不变量形式骨干之外的实践价值。**

| 方法 | 锚点 | 偏离骨干的原因 |
|---|---|---|
| 提取练习 | 作为学习的测试 | 强化 Ψ，不设定 $\rho$ 的拓扑 |
| 学习分析学 | 轨迹数据 | 提供代理指标，本身不具备最优拓扑 |

## 结论：预测、边界与可证伪纲领

一个单一结构不变量得到确认：学习者与 AI 导师构成一个相干二元组，其状态收敛于能力的自洽不动点，且存在难度的内部最优，最大掌握外观是理想误差的特征，

$$\Psi^* = \Phi(\Psi^*), \quad 0 < \rho^* < 1, \tag{12}$$

$$\mathrm{Quality}(\rho) \text{ 单峰；} \quad \max\, \mathrm{Appearance} = \mathrm{signature}(\delta_{\mathrm{ideal}}). \tag{13}$$

**认识论分层。** 最终不动点 (12) 与最大外观特征 (13) 汇聚了本工作的结论。被宣告为结构不变量（**L2-INVARIANT**）的有：弱环属性 (4)、难度内部最优的存在 (5) 以及可靠性内部最优的存在 (11)。被宣告为预测的是下列八个经验可检验推论。被宣告为假说的有：不动点算子 Φ (2)、$\rho^*$ 与 $S^*$ 的数值，以及第 7 节在可测量量层面的指标 [3]。

**九个可证伪检验（八项预测，一项假说）。** 该纲领是可操作化且可证伪的；表 4 汇集了每个预测、其应用可观测量、证伪条件和层级。

**P1（质量相对难度的倒 U 形）。** 学习质量作为呈现难度 $\rho$ 的函数，在 $\rho^* \in (0,1)$ 处单峰：当 $\rho \to 0$ 时出现无聊与停滞，当 $\rho \to 1$ 时出现过载与相干性崩溃。质量在 $\rho$ 中单调上升或单调下降均证伪内部最优的存在（**PREDICTION**，最锐利）。

**P2（在 $\rho^*$ 处呈现加速差距缩减）。** 相对于固定难度，将呈现内容保持在 $\rho^*$ 邻域内可加速掌握度差距 $\mathrm{gap}$ 的缩减；在 $\rho^*$ 处无加速证伪内部最优的作用（**PREDICTION**）。

**P3（弱环预测崩溃）。** $F$、$E$、$(1-\sigma)$、$\Lambda$ 中最小的因子比其平均值更能预测学习会话崩溃；在最小因子较高时出现会话崩溃证伪弱环属性 (4)（**PREDICTION**）。

**P4（掌握外观超前于掌握度）。** 在相干讲解后，学习者的主观自信超过无提示延迟测试的结果；自信与测试结果的联合增长证伪最大外观与理想误差特征的等同（**PREDICTION**）。

**P5（闭合反思环路胜过断裂环路）。** 具有闭合反思阶段 (10) 的二元组在相同时间内比无反思的二元组更快缩减掌握度差距；断裂环路的优越性证伪自我调节的作用（**PREDICTION**）。

**P6（自我评估校准度偏离掌握度）。** 在差距 $\mathrm{gap}$ 较大时，学习者自我评估的校准度偏离实际掌握度的程度随呈现相干性的升高而增大；在大差距下出现准确校准证伪理想误差机制（**PREDICTION**）。

**P7（依赖的内部最优）。** 掌握度收益作为对导师依赖份额 $S$ 的函数，在 $S^* \in (0,1)$ 处单峰：过低与过高的依赖均降低收益；收益对 $S$ 的单调依赖证伪可靠性最优的存在 (11)（**PREDICTION**）。

**P8（消除评价框架降低失配）。** 消除评价框架和刻板印象威胁可测量地降低失配度 $\sigma$ 并在保留能力的同时提升观测结果；$\sigma$ 无缩减证伪信心因子渠道（**PREDICTION**）。

**P9（二元组自我评估中的顺序效应）。** 学习者与导师的联合自我评估在问题呈现上表现出顺序效应，可由与经典模型相同参数数量下更优的情境依赖模型描述；顺序效应缺失证伪二元组自我观察的情境解读（**HYPOTHESIS**，最大胆）。

**表 4：验证纲领：预测 P1–P9 到应用可观测量的映射（待运行检验；没有任何对应关系被宣告为已确认）。**

| 预测 | 应用可观测量 | 证伪条件 | 层级 |
|---|---|---|---|
| P1 | 学习质量相对难度 $\rho$ | 单调性而非峰值 | PREDICTION |
| P2 | 在 $\rho^*$ 附近呈现时差距的缩减 | 在 $\rho^*$ 处无加速 | PREDICTION |
| P3 | $B$ 的弱环预测会话崩溃 | 最小因子较高时出现崩溃 | PREDICTION |
| P4 | 自信与测试结果 | 两者联合增长 | PREDICTION |
| P5 | 闭合反思环路相对于断裂环路 | 断裂环路占优 | PREDICTION |
| P6 | 自我评估校准度相对于掌握度 | 大差距下校准准确 | PREDICTION |
| P7 | 掌握度收益相对于依赖份额 $S$ | 单调性而非峰值 $S^*$ | PREDICTION |
| P8 | 消除评价框架降低 $\sigma$ | $\sigma$ 无缩减 | PREDICTION |
| P9 | 二元组自我评估中的顺序效应 | 无顺序效应 | HYPOTHESIS |

**边界与风险。** 边界被诚实地固定。跨领域对应关系仍是控制参数拓扑的结构类比；心理计量量与算子量有所不同，跨领域对单一标量的直接等同会滑入共鸣模拟 [3]。算子 Φ 以及 $\rho^*$、$S^*$ 的数值维持在假说层级；指标是可操作化代理指标，受同一证伪纲领约束。八项预测作为学习二元组经验检验的可操作化议程提出。

---

**利益冲突声明** 作者声明无利益冲突。

**资助声明** 本研究未获得外部资金资助。

## 参考文献

[1] Vygotsky L. S. Mind in Society: The Development of Higher Psychological Processes. Cambridge, MA: Harvard University Press, 1978.

[2] Csikszentmihalyi M. Flow: The Psychology of Optimal Experience. New York: Harper & Row, 1990.

[3] Pankratov A. S. ODTOE as an engineering framework for the coherence of technical systems: operator formalism, $B$-parameter metrology, and applications in cyber-physical, multi-agent, and AI systems // Universum: Technical Sciences. 2026. No. 6(147). P. 70–73. URL: [https://7universum.com/ru/tech/archive/item/22875](https://7universum.com/ru/tech/archive/item/22875).

[4] Bloom B. S. The 2 Sigma Problem: The Search for Methods of Group Instruction as Effective as One-to-One Tutoring // Educational Researcher. 1984. Vol. 13, no. 6. P. 4–16. DOI: 10.3102/0013189X013006004.

[5] Steele C. M., Aronson J. Stereotype threat and the intellectual test performance of African Americans // Journal of Personality and Social Psychology. 1995. Vol. 69, no. 5. P. 797–811. DOI: 10.1037/0022-3514.69.5.797.

[6] Zimmerman B. J. Becoming a Self-Regulated Learner: An Overview // Theory Into Practice. 2002. Vol. 41, no. 2. P. 64–70. DOI: 10.1207/s15430421tip4102_2.

[7] Parasuraman R., Riley V. Humans and Automation: Use, Misuse, Disuse, Abuse // Human Factors. 1997. Vol. 39, no. 2. P. 230–253. DOI: 10.1518/001872097778543886.

[8] Corbett A. T., Anderson J. R. Knowledge tracing: Modeling the acquisition of procedural knowledge // User Modeling and User-Adapted Interaction. 1995. Vol. 4, no. 4. P. 253–278. DOI: 10.1007/BF01099821.

[9] Piech C. et al. Deep Knowledge Tracing // Advances in Neural Information Processing Systems (NeurIPS). 2015. arXiv:1506.05908. URL: [https://arxiv.org/abs/1506.05908](https://arxiv.org/abs/1506.05908).

[10] Deci E. L., Ryan R. M. Intrinsic and Extrinsic Motivations: Classic Definitions and New Directions // Contemporary Educational Psychology. 2000. Vol. 25, no. 1. P. 54–68. DOI: 10.1006/ceps.1999.1020.

[11] Karpicke J. D., Roediger H. L. The Critical Importance of Retrieval for Learning // Science. 2008. Vol. 319. P. 966–968. DOI: 10.1126/science.1152408.

[12] Siemens G. Learning Analytics: The Emergence of a Discipline // American Behavioral Scientist. 2013. Vol. 57, no. 10. P. 1380–1400. DOI: 10.1177/0002764213498851.
