探清 Agent 时代
运维的方法与边界

运维主体从人转向 Agent,实施方式从 Console 转向 API,AI 运维距离真正的生产落地还有多远?

把控 AI 运维的风险

我们在探索 No Console:用代码和 API 做事,用流程管安全和权限。

安全为基线

权限、隔离、审计是默认前提,不是事后补丁

设计驱动

先把账号、流程和变更路径设计清楚,再放开自动化

人在回路

敏感动作由人授权、审批、担责

用 Landing Zone 压住失控范围

让 Agent 自主操作的前提是账号边界能兜住。单账号混用最容易踩这三类坑:

  • 权限跟着人走:个人账号绑高权限,换人或离职权限就没人管
  • 缺少账号隔离:开发、测试、生产混在同一个账号,误操作一炸就是全部
  • 失控范围不明确:出事了到底影响多大,没人说得清

Landing Zone 用账号隔离和最小权限,把单点失控压到可接受范围。账号边界立住了,再让 Agent 动手才有意义。

立即前往

用 IaC 给 Agent 可读拓扑

账号隔离只解决谁能动。Agent 还要看清环境里有什么、归谁、怎么改过。手动操作最容易踩这三类坑:

  • 架构只在脑子里:拓扑靠人记,资源难盘清
  • 业务属性缺失:不知道谁建的、归谁管,不敢动,僵尸资源堆着
  • 变更难追溯:谁改的、为什么改的,都对不上,审计接不住

IaC 把资源写成代码,拓扑和变更都能留下。Agent 才能据此分析和变更。

立即前往

带着 Agent 做运维的三步

原则已经立了。开工按这个顺序:先写清目标,再给最小权限,关键动作留人确认。

先定目标与风险

先写清 Agent 要做什么、中间有哪些风险。目标写死了,它会一个劲往完成任务赶;你没写明的约束,它也可能绕开。

最小权限

默认只给完成任务所需的最低权限。敏感操作再由人临时授予。

关键变更要人确认

需求没说清、理解偏了,不能让 Agent 独自拍板。关键变更要人确认、人兜底。