Knowledge Catalog 企业级知识库实战教程: Part2_实战指南与使用示例详解
文章目录第十六章:环境搭建与快速开始16.1 系统要求16.1.1 硬件要求16.1.2 软件要求16.1.3 GCP账号要求16.2 开发环境安装16.2.1 步骤一:安装Python和包管理器16.2.2 步骤二:安装gcloud CLI并认证16.2.3 步骤三:(可选)安装Node.js和npm16.3 项目克隆与初始化16.3.1 克隆仓库16.3.2 安装Python依赖16.3.3 (可选) 安装TypeScript依赖16.4 第一个Bundle:5分钟体验16.4.1 步骤一:创建Bundle目录结构16.4.2 步骤二:创建Bundle索引文件16.4.3 步骤三:创建第一个表文档16.4.4 步骤四:创建订单表文档16.4.5 步骤五:创建指标文档16.4.6 验证Bundle结构16.5 验证安装第十七章:OKF文档编写实战17.1 手动编写第一个OKF文档17.1.1 场景描述17.1.2 完整文档示例17.2 Frontmatter编写指南17.2.1 Identity字段(必需)type字段title字段description字段17.2.2 generated字段(必需)17.2.3 可选字段详解resource字段tags字段verified字段sources字段status字段stale_after字段17.3 Body内容编写最佳实践17.3.1 结构组织原则17.3.2 Schema章节编写17.3.3 Examples章节编写17.3.4 Cross-linking(交叉链接)17.4 常见文档类型模板17.4.1 BigQuery Table模板17.4.2 Metric模板17.4.3 Playbook模板17.4.4 API Endpoint模板17.5 文档验证与质量检查17.5.1 自动化验证脚本17.5.2 质量检查清单第十八章:Reference Agent实战操作18.1 Agent配置详解18.1.1 配置文件结构18.1.2 环境变量配置18.1.3 编程式配置18.2 交互模式使用18.2.1 启动交互模式18.2.2 交互界面示例18.2.3 交互模式高级技巧18.3 单次查询模式18.3.1 基本用法18.3.2 在脚本中使用18.3.3 管道集成示例18.4 批量处理模式18.4.1 从文件读取查询18.4.2 批量文档生成18.5 高级对话技巧18.5.1 Prompt Engineering最佳实践18.5.2 处理复杂场景第十九章:数据源连接实战19.1 BigQuery数据源配置19.1.1 基础配置19.1.2 认证方式19.1.3 连接测试19.2 Dataplex Catalog集成19.2.1 配置Dataplex源19.2.2 使用mdcode进行同步19.2.3 Dataplex Entry Types映射19.3 自定义数据源开发19.3.1 完整的自定义数据源示例19.3.2 注册自定义数据源19.4 多数据源联合查询19.4.1 配置多个源19.4.2 联合查询示例19.5 数据源性能优化19.5.1 缓存策略19.5.2 分页处理大数据集第二十章:Catalog Sync同步实战20.1 初始化Sync工作区20.1.1 使用mdcode init20.1.2 手动创建catalog.yaml20.2 Pull操作完整流程20.2.1 基本Pull20.2.2 Pull过程详解20.2.3 Pull后的目录结构20.3 编辑本地知识文档20.3.1 从Snapshot生成OKF文档20.3.2 编辑现有文档20.4 Push操作完整流程20.4.1 基本Push20.4.2 Push过程详解20.4.3 Push报告示例20.5 冲突解决策略20.5.1 当前行为20.5.2 手动冲突解决工作流20.5.3 未来计划(来自代码TODO)20.6 定期同步自动化20.6.1 Cron Job设置20.6.2 GitHub Actions示例第二十一章:mdcode CLI工具完全指南21.1 安装与配置21.1.1 安装21.1.2 验证安装21.2 核心命令详解21.2.1 mdcode init21.2.2 mdcode pull21.2.3 mdcode push21.2.4 mdcode status21.2.5 mdcode validate21.2.6 mdcode generate-view21.3 高级命令与选项21.3.1 全局选项21.3.2 环境变量21.4 工作流集成21.4.1 Git Hook集成21.4.2 Makefile集成21.5 故障排查21.5.1 常见错误及解决方案21.5.2 调试模式第二十二章:Enrichment Agent增强实战22.1 Enrichment Agent安装22.1.1 构建和安装22.2 配置与定制22.2.1 配置文件结构22.2.2 MCP配置22.3 执行增强任务22.3.1 增强单个文档22.4 自定义增强规则22.5 批量增强工作流22.5.1 CI/CD中的自动增强第二十三章:Viewer站点生成实战23.1 生成HTML站点23.1.1 基本生成23.1.2 生成的站点结构23.2 自定义模板23.2.1 模板目录结构23.2.2 自定义文档模板示例23.3 部署站点23.3.1 部署到GitHub Pages23.3.2 部署到Cloud Storage23.3.3 部署到Cloud Run23.4 搜索与导航23.4.1 内置搜索功能23.5 多语言支持23.5.1 i18n配置第二十四章:Attested Computation认证计算实战24.1 创建计算指标24.1.1 定义指标文档24.2 编写Executor24.3 编写Attester24.4 运行与验证24.4.1 手动运行24.4.2 定期自动验证24.5 复杂计算案例案例:客户生命周期价值(LTV)第二十五章:Discovery Agent发现代理实战25.1 运行Discovery示例25.1.1 准备工作25.1.2 运行基本发现25.1.3 输出示例25.2 自定义发现范围25.2.1 通过SKILL文件配置25.2.2 通过代码配置25.3 发现结果后处理25.3.1 审查和改进25.3.2 优先级排序25.4 与CI/CD集成25.4.1 自动发现新资产的Workflow25.5 大规模发现最佳实践25.5.1 分阶段发现25.5.2 发现治理第二十六章:完整项目实战:构建企业级知识库26.1 项目规划与设计26.1.1 需求收集26.1.2 解决方案架构26.1.3 技术选型26.2 团队协作设置26.2.1 仓库结构26.2.2 贡献指南26.3 分阶段实施Phase 1: 基础设施(第1-2周)Phase 2: 自动化(第3-4周)Phase 3: 扩展(第5-8周)26.4 监控与维护26.4.1 健康仪表板26.4.2 定期维护任务26.5 扩展与演进26.5.1 未来路线图26.5.2 成功指标第二十七章:故障排查与问题解决27.1 常见错误及解决方案27.1.1 安装问题27.1.2 运行时问题27.1.3 同步问题27.2 调试技巧27.2.1 启用详细日志27.2.2 交互式调试27.3 日志分析27.3.1 日志格式27.3.2 日志分析命令27.4 性能问题诊断27.4.1 常见性能瓶颈27.4.2 性能分析脚本27.5 社区支持资源27.5.1 官方渠道27.5.2 报告问题的模板附录D:命令速查卡Reference Agent CLImdcode CLIEnrichment AgentDiscovery Agent第十六章:环境搭建与快速开始本章将指导你从零开始搭建Knowledge Catalog的完整开发环境,并完成第一次实际操作。16.1 系统要求16.1.1 硬件要求组件最低要求推荐配置CPU2核心4核心以上内存4GB RAM8GB以上硬盘10GB可用空间30GB以上(含Git仓库和依赖)网络稳定的互联网连接低延迟网络(GCP API调用)16.1.2 软件要求软件版本要求用途Python3.10或更