Havenlon|AI 时代的执行安全语言体系(六七):恢复边界
Working Draft · AI Era Execution Security LanguageThis article is part of the Havenlon Execution Security Language project.The terminology and definitions presented here describe the currentworking draft and may evolve as the discipline matures.AI 时代执行安全语言体系工作草案本系列旨在建立 AI 时代执行安全的共同语言。本文中的术语与定义代表当前工作草案将随着理论研究、工程实践和社区讨论持续修订25. Recovery Boundary恢复边界一句话定义恢复边界是限制谁能够在什么条件下修复、替换、重建或解除安全状态的治理与技术边界。严格定义Recovery Boundary 必须覆盖Owner RecoveryDevice ReplacementCredential RotationEvidence Chain RepairGovernance State RebuildFirmware RecoveryCounter MigrationSafe Mode ExitLockdown Exit。恢复边界必须回答谁可以发起恢复谁必须参与是否需要物理存在恢复影响哪些状态哪些旧权限被撤销新权限何时生效是否存在冷静期是否保留原证据恢复后是否进入受限模式谁能够证明恢复完成。上位概念Governance BoundaryPhysical Trust Boundary下位概念Owner Recovery BoundaryDevice Recovery BoundaryEvidence Recovery BoundaryFirmware Recovery BoundarySafe Mode Exit Boundary相关概念Physical Recovery ModeGovernance RecoveryRecovery EvidenceBoundary of BoundariesNo Unilateral Catastrophic Authority权力边界恢复权不能自动包含删除全部历史重置全部 counter关闭全部 Policy立即执行高风险动作绕过治理重新获得旧密钥。约束机制多方治理物理操作时间窗口新旧状态绑定旧凭证撤销冷静期恢复后低权限完整留证。结果目标让系统可以从严重异常中恢复但不让恢复机制成为比正常执行更强的万能后门。在 Havenlon 中Safe Mode、Lockdown、Owner 和设备恢复都必须经过本地物理与治理条件。失败模式与系统状态关系总图Failure Detected ↓ Failure Classification │ ├── 可继续且风险有限 │ ↓ │ Degraded Operation │ ↓ │ Restricted Mode │ ├── 关键条件无法验证 │ ↓ │ Safe Mode │ ├── 执行根或边界可信性受损 │ ↓ │ Lockdown │ └── 需要现场修复或重建 ↓ Physical Recovery Mode ↓ Recovery Boundary ↓ Recovery Evidence安全失败与不安全失败的区别Safe Failure 异常发生 → 权力收缩 → 高风险动作停止 → 状态显式可见 → 形成证据 → 受控恢复 Unsafe Failure 异常发生 → 检查被跳过 → 权限放宽 → 启用旁路 → 继续不可逆执行 → 证据可能缺失核心区别不是系统是否继续运行而是失败以后执行能力是缩小了还是扩大了。Safe Mode、Restricted Mode 与 Lockdown 的区别Restricted Mode受限模式 系统仍然可信但部分能力不可用或风险上升。 允许有限、低风险、白名单动作。 Safe Mode安全模式 关键安全条件无法完整验证。 高风险执行停止只保留最小安全功能。 Lockdown锁定状态 执行根、设备身份或边界本身可能失陷。 所有受保护执行停止只允许诊断和恢复。失败传播的典型路径Policy 服务不可用 ↓ 使用过期缓存 ↓ 继续允许执行 ↓ 累计状态不准确 ↓ 额度被突破 ↓ 灾难半径扩大安全响应应是Policy 服务不可用 ↓ 检查本地 Policy Freshness ↓ 收紧本地额度 ↓ 进入 Restricted Mode ↓ 超过离线窗口后进入 Safe Mode另一个例子Evidence Store 背压 ↓ 停止记录拒绝 ↓ 继续处理执行 ↓ 状态无法审计 ↓ 请求重复执行安全响应应是Evidence Backpressure ↓ 降低 Rate Limit ↓ 拒绝低优先级请求 ↓ 达到 Backpressure Threshold ↓ 停止高风险执行失败状态的能力矩阵Normal Mode ├── 正常提议 ├── 正常审批 ├── 自动化 ├── 高风险执行 └── 治理变更 Restricted Mode ├── 查询与证据导出 ├── 低风险执行 ├── 白名单对象 ├── 人工确认 └── 禁止高风险治理 Safe Mode ├── 查询 ├── 诊断 ├── 证据导出 ├── 受控恢复准备 └── 拒绝不可逆执行 Lockdown ├── 最小诊断 ├── 原始证据导出 ├── 设备状态证明 └── 物理恢复入口 Physical Recovery Mode ├── 设备或身份重建 ├── 证据核验 ├── 凭证轮换 ├── 治理恢复 └── 禁止普通业务执行限额、限频与限域的关系Amount Limit 限制 一次或累计最多损失多少。 Rate Limit 限制 损失发生得有多快。 Scope Limit 限制 损失能够影响哪些对象和场景。 TimeGuard 限制 执行可以在什么时候发生。 DistanceGuard 限制 执行必须在什么位置或接近关系下发生。共同构成Value Bound Speed Bound Scope Bound Time Bound Location Bound Bounded Execution Risk失败模式评审问题评估一套执行系统时至少应回答系统定义了哪些 Failure Mode每种失败由什么条件触发失败后哪些状态仍然可信失败后哪些执行能力仍然可用未知异常默认进入什么状态Policy 不可用时系统继续还是拒绝Approval 状态无法确认时如何处理SaaS 不可用时是否启用更宽松路径Arbiter 不可用时是否允许应用直达 ExecutorSecurity Domain 不可用时是否存在软件备用密钥Evidence Store 满时是否继续执行counter 异常时是否进入 Safe Mode失败是否能够静默发生UI 状态是否可能与真实设备状态不一致部分失败是否被建模Commit 成功但 Executor 失败时如何处理Executor 调用后 Receipt 丢失时如何处理模糊状态是否允许自动重试多步骤动作部分完成时是否存在补偿机制重试是否具有幂等性一个组件失败是否会沿链路传播下游是否保留独立拒绝权多个组件是否存在共因失效多个审批账户是否真正独立多个硬件域是否共享同一更新密钥系统有哪些可用性单点系统有哪些灾难性执行单点一个 Owner 失陷后最多能做什么一个 SaaS 管理员失陷后最多能做什么一个 Key Slot 失陷后的最大范围是什么Safe Mode 的进入条件是什么Safe Mode 中允许哪些动作谁可以退出 Safe ModeSaaS 能否远程退出 Safe ModeRestricted Mode 与 Safe Mode 有何区别Lockdown 在什么情况下触发Lockdown 是否停止所有受保护执行Lockdown 是否仍允许证据导出Physical Recovery Mode 是否禁用正常业务执行恢复模式是否比正常模式权限更大恢复是否需要多方和物理条件恢复后是否立即恢复全部权限是否设置恢复冷静期Backpressure 有哪些来源Backpressure Threshold 如何分级达到阈值后是限流还是丢弃证据TimeGuard 依赖什么时间源时间回退时如何处理DistanceGuard 是否被当成唯一安全条件Rate Limit 是否按身份、对象和槽位分别实施Amount Limit 是否考虑拆单和累计Scope Limit 是否阻止跨对象和跨场景使用未知对象是否默认拒绝未知消息类型是否默认拒绝Refuse to Execute 是否真实阻止密钥调用拒绝是否形成 Denial EvidenceFail-Secure 是否是系统默认还是个别模块行为备用路径是否遵守相同约束失败、降级、锁定和恢复是否全部留证系统失败时执行权最终是收缩还是扩张如果这些问题没有明确答案系统可能只定义了正常流程却没有定义真正决定灾难半径的失败行为。本章核心公理所有复杂系统都会失败安全的区别在于失败后权力如何变化。安全失败不是系统永远停止而是在判断能力下降时优先收缩高风险执行能力。不安全失败最常见的表现是某个安全组件不可用后系统为了保持业务连续而自动放宽限制。静默失败比显式失败更危险因为系统会在错误状态下继续表现得像一切正常。部分失败必须明确哪些结果已经不可逆不能简单回滚状态或整体重试。级联失效发生在一层错误被下游无条件继承时分层不信任的价值就是阻止这种传播。多个组件不等于多个独立边界共享管理员、更新密钥或恢复入口可能造成共因失效。单点故障是可用性问题单点灾难性执行是权力问题。系统可以接受某个组件故障导致停机但不能接受某个组件失陷后独自完成灾难。Restricted Mode 保留有限能力Safe Mode 停止高风险能力Lockdown 停止全部受保护执行能力。恢复模式不是超级管理员模式恢复过程必须比普通执行受到更严格约束。降级运行应当减少功能而不是降低安全标准。背压必须向上游传播为限流和拒绝不能向下游传播为证据丢失和约束绕过。TimeGuard 限制执行何时发生DistanceGuard 限制执行在什么位置条件下发生。Amount Limit 限制损失规模Rate Limit 限制损失速度Scope Limit 限制损失范围。默认拒绝不是保守偏好而是未知状态不能自动获得现实执行资格。拒绝执行必须真实阻止签名、提交或 Executor 调用而不是只返回一个软件错误。恢复边界决定谁能够重新赋予系统执行能力因此恢复权本身就是高风险治理权。失败模式最终决定的不只是系统是否可用而是单点错误最多能走多远。Havenlon 对失败模式与系统状态的基本回应Havenlon 不假设身份、网络、SaaS、Policy、硬件、证据或外部执行系统永远可用。它要求为关键异常定义明确 Failure Mode区分 Safe Failure 与 Unsafe Failure禁止关键安全依赖失效后自动 fail-open让所有失败显式可见防止 Silent Failure将 Partial Failure 建模为独立状态区分明确未执行、部分执行和状态未知禁止模糊状态无条件重试使用幂等键和 Commit ID 约束重试识别并阻断 Cascading Failure检查跨组件 Common-Mode Failure区分 Single Point of Failure 与 Single Point of Catastrophic Execution优先消除单点灾难性权力为异常定义 Restricted Mode为关键状态无法验证定义 Safe Mode为执行根或设备身份失陷定义 Lockdown为现场修复定义 Physical Recovery Mode让降级运行收缩功能而不放宽边界为 Evidence、Executor、网络和审批队列定义 Backpressure设置多级 Backpressure Threshold背压超限时先限流再拒绝再进入 Safe Mode使用 TimeGuard 约束时效、顺序和冷静期使用 DistanceGuard 约束本地存在、区域和设备接近关系使用 Rate Limit 限制自动化和攻击传播速度使用 Amount Limit 限制最大资产或业务损失使用 Scope Limit 限制可影响对象和场景让本地硬上限不能被 SaaS 放宽对未知对象、未知状态和未知消息默认拒绝让 Refuse to Execute 真实阻断签名和 Executor将 Fail-Secure Default 作为系统级默认让故障、拒绝、降级、锁定和恢复全部形成证据让 Safe Mode 和 Lockdown 不能由普通远程管理员解除让 Physical Recovery Mode 禁止普通业务执行让 Recovery Boundary 受到多方治理、物理条件和时间约束让恢复后先进入受限状态而不是立即恢复全部权力让恢复过程保留旧状态与完整 Recovery Evidence让所有备用、维护和恢复路径遵守相同或更严格的执行边界让任何组件失败后执行能力默认缩小而不是扩大。最终原则是Havenlon 不承诺系统永远不会失败。它要求系统在失败时仍然知道自己还能做什么、不能做什么以及谁有资格让它恢复。真正安全的系统不是永远在线的系统而是在失去确定性时仍然拒绝把不确定性转化为灾难性执行的系统。