[论文学习]AI4AI at Scale:有界探索框架下的智能体系统规模化优化
AI4AI at Scale有界探索框架下的智能体系统规模化优化论文重点本文提出了一种名为AI4AI的有界探索bounded-exploration、验证门控verification-gated框架用于系统性地提升大语言模型的智能体Agentic能力。研究团队基于 Qwen3.6-35B-A3B 和 Qwen3.5-397B-A17B 构建了 XYZ-Aquila-mini 和 XYZ-Aquila-pro 两个 Deep Search 智能体在 BrowseComp、BrowseComp-ZH、LiveBrowseComp、WideSearch 等多个基准测试中取得了同参数量级下的最优成绩。核心研究内容问题定义提升 LLM 的智能体能力是一项复杂的系统工程。一个 capable 的智能体需要具备长程规划、工具调用、证据核查、故障恢复、约束遵循等多维能力而这些能力并非仅由模型 checkpoint 决定而是从模型选择、数据构建、后训练策略、工具接口、验证器设计、上下文管理、基础设施等耦合组件的交互中涌现。传统方法中孤立地优化单一组件往往带来脆弱的收益、隐蔽的性能退化或无法迁移到开发环境之外。更关键的是让当前的 LLM 智能体自主完成端到端的系统优化仍然远超其可靠能力范围——搜索空间巨大、组件间交互微妙而 naive 的自动化可能掩盖变更的真正原因、过拟合于可用反馈、或模糊不安全决策的责任归属。创新方法论文的核心创新在于提出了一个有界探索的 AI4AI 优化机制其关键设计包括人类定义优化契约人类设定目标能力、私有代理基准、资源与工具范围、风险边界和接受标准形成一个版本化的契约 H(νt)。四阶段循环AI 智能体在契约约束下执行研究Research→ 开发Development→ 评审Review→ 记录Record的迭代循环。隔离评估器与验收门控独立的评估器 E_gate 返回指标和诊断信号但绝不暴露答案键或私有标签验收策略 G 根据证据决定采纳或拒绝。共享经验记忆无论采纳还是拒绝的尝试都被完整记录在持久化的共享记忆 F_t 中包含溯源信息、适用条件、置信度等使后续循环能够避免重复失败、复用成功经验。人机协作人类通过契约和例外评审行使权威AI 负责具体运营工作而非要求人类审批每一个底层步骤。研究成果XYZ-Aquila 系列在多个权威智能体基准测试中表现优异基准XYZ-Aquila-mini (40B)XYZ-Aquila-pro (400B)BrowseComp78.8%同級第184.8%同級第1BrowseComp-ZH82.9%同級第185.1%同級第1LiveBrowseComp48.7%同級第153.7%同級第1WideSearch80.8%同級第181.2%同級第1DeepSearchQA89.5%同級第192.5%同級第2Humanity’s Last Exam51.1%同級第153.3%同級第1XYZ-Aquila-pro 在 BrowseComp-ZH、LiveBrowseComp 和 WideSearch 上更是刷新了所有公开系统的最高记录包括超过 1T 参数的闭源模型。实际落地应用的可能性该框架具有广泛的适用性——论文明确指出AI4AI 的优化机制不仅限于 Deep Search而是可以推广到任何复杂的 AI 系统开发场景。具体应用场景包括LLM 后训练流水线优化自动诊断 SFT/RL/DPO 策略的缺陷并迭代改进RAG 系统调优优化检索策略、上下文窗口、工具调用配置软件工程智能体辅助代码生成、测试、调试的迭代优化科研自动化类似 AI Scientist 的思路但增加了有界约束和审计能力技术细节优化契约的形式化定义论文将智能体系统形式化为一个配置 θ涵盖模型、学习过程、策略、工具、数据、评估和基础设施七个维度θ∈Θ,Θ⊆Θmodel×Θlearn×Θpolicy×Θtool×Θdata×Θdev-eval×Θinfra \theta \in \Theta, \quad \Theta \subseteq \Theta_{\text{model}} \times \Theta_{\text{learn}} \times \Theta_{\text{policy}} \times \Theta_{\text{tool}} \times \Theta_{\text{data}} \times \Theta_{\text{dev-eval}} \times \Theta_{\text{infra}}θ∈Θ,Θ⊆Θmodel×Θlearn×Θpolicy×Θtool×Θdata×Θdev-eval×Θinfra人类定义的版本化优化契约为H(νt)⟨J,Bpriv,Egate,CH,G,Bcycle,τstop⟩ H(\nu_t) \langle J, B_{\text{priv}}, E_{\text{gate}}, C_H, G, B_{\text{cycle}}, \tau_{\text{stop}} \rangleH(νt)⟨J,Bpriv,Egate,CH,G,Bcycle,τstop⟩其中 J 为目标能力B_priv 为私有代理基准E_gate 为隔离评估器C_H 为可容许性谓词G 为版本化验收策略B_cycle 为每周期资源预算τ_stop 为停止条件。四阶段循环的核心公式研究阶段Research 模块诊断当前系统并提出可容许的干预方案(at,u^t,rt)Rϕ(θt,Ft,ht;H(νt)),at∈AH(θt),c(at)≤Bcycle (a_t, \hat{u}_t, r_t) R_\phi(\theta_t, F_t, h_t; H(\nu_t)), \quad a_t \in A_H(\theta_t), \quad c(a_t) \leq B_{\text{cycle}}(at,u^t,rt)Rϕ(θt,Ft,ht;H(νt)),at∈AH(θt),c(at)≤Bcycle开发阶段实施干预生成候选系统θ~tf(θt,at),CH(θ~t)1 \tilde{\theta}_t f(\theta_t, a_t), \quad C_H(\tilde{\theta}_t) 1θ~tf(θt,at),CH(θ~t)1评审阶段隔离评估器生成证据包ztEgate(Aθ~t;Bpriv) z_t E_{\text{gate}}(A_{\tilde{\theta}_t}; B_{\text{priv}})ztEgate(Aθ~t;Bpriv)dtG(zt,ztref,at;H(νt))∈{accept,reject,escalate} d_t G(z_t, z^{\text{ref}}_t, a_t; H(\nu_t)) \in \{\text{accept}, \text{reject}, \text{escalate}\}dtG(zt,ztref,at;H(νt))∈{accept,reject,escalate}记录阶段完整记录周期证据并更新共享记忆et⟨θt,at,θ~t,zt,dt,rt,νt,vt⟩,Ft1Update(Ft,et) e_t \langle \theta_t, a_t, \tilde{\theta}_t, z_t, d_t, r_t, \nu_t, v_t \rangle, \quad F_{t1} \text{Update}(F_t, e_t)et⟨θt,at,θ~t,zt,dt,rt,νt,vt⟩,Ft1Update(Ft,et)有界性的五重约束论文明确了“有界”并非指搜索空间小而是指受约束的权限、证据访问和资源使用范围边界仅允许修改指定的设计面和干预类别权限边界仅允许使用授权的数据源、工具、模型和基础设施评估边界隐藏标签、答案键和外部基准对优化器不可见资源边界每周期受计算、时间、rollout 和评估预算限制权限边界高风险、模糊或超出契约的案例必须被拒绝或升级研究设定硬件与软件配置论文中 XYZ-Aquila 系列基于以下配置构建组件XYZ-Aquila-miniXYZ-Aquila-pro基座模型Qwen3.6-35B-A3BQwen3.5-397B-A17B参数量级 40B 400B架构MoE混合专家MoE混合专家系统设计亮点图 grounding 工具可达的任务构建智能体基于图结构进行任务规划和证据获取。状态保真的 SFT监督微调保持状态一致性。固定三工具执行契约明确的上下文策略和精确回放状态。外部评估隔离外部基准不参与常规优化循环仅用于最终或明确授权的评估。低成本筛选机制对昂贵的干预类别如 RL先进行低成本试点验证通过后才投入完整训练和评估预算。开源资源团队已公开模型权重、评估代码、训练细节、代表性轨迹和版本化干预记录ModelScope: https://www.modelscope.cn/models/XYZAILabHugging Face: https://huggingface.co/XYZAILabGitHub: https://github.com/XYZ-AI-Lab综合分析理论贡献本文的核心理论贡献在于将 AI 系统优化从“黑箱调参”转变为“可审计、可复现的治理流程”。传统 AutoML 或超参数优化往往只关注单一维度的数值优化而 AI4AI 框架将优化对象扩展到了整个系统设计空间——从模型、数据、训练策略到工具和基础设施——并引入了人类定义的契约作为“宪法”来约束 AI 的探索行为。这种方法论上的转变具有深远的学术意义。论文明确指出智能体能力是完整系统的涌现属性而非孤立模型 checkpoint 的属性。这一观点挑战了当前以模型为中心的主流评估范式为 Agentic AI 的评估和优化提供了新的理论框架。实践价值从实践角度看AI4AI 框架解决了三个核心痛点可解释性每一次干预都被完整记录包括被拒绝的尝试及其失败原因。这使得优化过程不再是“炼丹”而是可追溯的工程过程。防止过拟合通过隐藏私有标签、隔离外部基准、限制每周期评估次数等措施有效防止了对开发集的过度适应。人机协同的平衡框架既不过度依赖人类手动调参低效也不完全放任 AI 自主优化危险而是通过契约、门控和例外升级实现了可控的自动化。局限性与未来方向论文也坦诚指出了若干局限性基准对比基于异构的公开报告不同系统的评估工具、裁判、时间点可能存在差异并非严格受控的总序比较。框架的有效性目前仅在 Deep Search 场景中得到验证推广到其他类型的 AI 系统如多模态、具身智能仍需进一步研究。有界探索的设计虽然增强了安全性但也可能限制了某些“跳出框架”的创新发现。实践应用对研究者的建议从小规模开始如果希望在自己的项目中引入 AI4AI 框架建议先从单一优化面如仅优化 SFT 数据或仅优化工具调用策略开始逐步扩展到多维度联合优化。重视“失败记录”论文中最具启发性的设计之一是对被拒绝的尝试也进行完整记录。在实际应用中建立“失败案例库”往往比只记录成功经验更有价值——它帮助后续优化避免重复踩坑。谨慎设计契约优化契约中的风险边界和验收标准是框架安全性的基石。建议在初期设置较严格的约束随着对系统的理解加深再逐步放宽。对工程团队的启示构建共享经验记忆AI4AI 的 Shared Experience Memory 本质上是团队知识的数字化沉淀。工程团队可以借鉴这一思路将每一次实验无论成败的上下文、配置、结果和人工评审意见结构化存储形成组织的“集体智能”。分离评估与优化论文中“隔离评估器”的设计提醒我们在 AI 系统开发中应严格区分用于指导优化的信号和用于最终评估的信号——前者可以频繁使用后者应谨慎保留。低成本筛选先行对于计算成本高昂的干预方案如大规模 RL 训练先进行低成本试点验证是明智的工程实践。参考资料原始论文https://xyz-lab.ai/blogs/ai4ai-at-scale/assets/bounded-exploration-ai4ai-system-optimization.pdf模型ModelScopehttps://www.modelscope.cn/models/XYZAILab模型Hugging Facehttps://huggingface.co/XYZAILab数据集ModelScopehttps://www.modelscope.cn/datasets/XYZAILab代码仓库https://github.com/XYZ-AI-Lab