第 05 模块 · 2 节

交付、监控与运维

《Claude Code 生产级工程》05 生产级项目实战 · 本节时长 34 分钟

上线不是终点,是运维的开始

方案设计好了,部署上去只是第一步。真正的考验在上线之后:它跑得稳吗?出问题能发现吗?出问题能回滚吗?这一节讲交付、监控与运维。

生产级的标志,是「出了问题能知道、能定位、能恢复」。

贯穿项目mcp-hub 架构画好了,这一节把它**真正交付给团队**,并建好上线后的运维:交付要可重复、出问题要看得见、坏配置能回滚。**mcp-hub 从「设计」走向「真正给团队用、长期运维」。**

交付:让「部署」可重复、可回滚

生产级交付不是「手工敲命令上线」,而是:

  • 可重复:同样的流程,跑一次和跑一百次结果一样
  • 可回滚:出问题能退回到上一个稳定版本

手段:把部署流程脚本化/流水线化,锁版本、留记录。

对 mcp-hub:给团队的安装流程写一个脚本,一条命令装好,锁版本号。别让「让新人装上 mcp-hub」成为某个老员工的专属技能。


一个可复制的交付脚本思路

给 mcp-hub 定一个可重复的交付流程,团队照抄:

# 交付脚本思路:一条命令让新成员装好 mcp-hub
# 1. 从仓库拉取 mcp-hub 到配置目录
git clone <team-repo> $MCP_HUB_DIR
# 2. 锁版本(读到哪个 tag 就是哪个版本)
cd $MCP_HUB_DIR && git checkout v0.1.0
# 3. 校验配置可用
/mcp-hub validate
# 4. 汇报结果
echo "mcp-hub v0.1.0 已安装,可运行 /mcp-hub list"

可重复、可回滚(回滚 = 换回上一个 tag)、有记录,就是生产级交付。


监控:出问题先要「看得见」

不监控,问题就是「用户报了你才知道」。要主动看到:

监控什么 看什么
用量 Token、成本、调用次数
错误 失败率、异常堆栈
性能 响应时间、是否变慢

监控的意义:在用户发现之前,你先发现。

对 mcp-hub:重点监控哪些服务调用失败多、哪些服务在烧钱、哪个 Server 响应慢——这些直接反映团队日常用 mcp-hub 有没有异常。


告警:别等用户来报

光有监控不够,要有告警——出问题主动通知你:

  • 错误率超过阈值 → 告警
  • 用量接近预算 → 告警
  • 服务响应变慢 → 告警

告警让你「被动变主动」,问题还没扩散就被处理。

对 mcp-hub:给几个关键指标设阈值——比如「某个服务的调用失败率超过 X% 就告警」「团队月度成本接近预算就告警」。问题第一时间找上你,而不是你去找问题。


运维:生产环境的三个铁律

1. 生产操作,谨慎再谨慎

对生产环境的一切操作要克制:能不动就不动,动了要有记录、可回滚。

2. 敏感操作,必须人工确认

删除、改数据、改配置这类,AI 或脚本都不能自作主张,必须人工把关。

3. 一切有记录

谁在什么时候做了什么,能查得到。出了问题能回溯到源头。

对 mcp-hub:尤其「删服务」「改生产凭据」「改权限」这类,一律走人工确认 + 留记录。


一套可落地的运维流程

上线前:脚本化部署 + 锁版本 + 记录
上线中:灰度/分批,别一把梭
上线后:监控 + 告警 + 定期检查
出问题:先回滚 → 定位 → 修复 → 再上线

让运维成为「流程」,而不是「每次手忙脚乱」。

对 mcp-hub 团队:给「mcp-hub 出问题」预设一个标准动作——先回滚到上一个稳定版本、再看日志定位、修好再上。有预案,出事才不慌。


常见误区

  • 部署全靠手动:不可重复、不可回滚
  • 没监控没告警:问题靠用户发现
  • 生产环境乱操作:没有记录、没有确认

对 mcp-hub:这三点在团队共享场景下都会放大——一旦 mcp-hub 出问题,是全团队一起受影响。


落地练习:把 mcp-hub 正式交付并建好运维

这一节,完成 mcp-hub 的交付与运维落地。

跟着这三步走:

  1. 把 mcp-hub 的安装流程写成脚本,锁版本,让「一条命令装好」成为可能
  2. 给 mcp-hub 设几个监控指标和告警阈值(失败率、成本接近预算等)
  3. 写一份「mcp-hub 出问题怎么办」的预案:先回滚、再定位、修好再上

你会怎么判断做对了?——一个新成员照脚本一条命令装上 mcp-hub;关键指标有告警、问题能先被发现;出事有回滚预案。三者都做到,就算过关。

卡住了怎么办? 写不出完整脚本?先写「clone + checkout + validate」三步的最小版。监控不会搭?先从「手动定期看用量/错误」做起。预案不会写?就写「回滚到上一 tag → 看日志 → 修复」三行,先立起来。


常见坑:交付完了就不管了,没有运维预案

一个很真实的坑:mcp-hub 交付那天很兴奋,但没有监控、没有告警、没有回滚预案。直到某天团队集体报「查不到数据了」,你才开始排查——这时候已经是「用户先发现」了。

上线不是结束,运维才是日常。 交付时就把「监控 + 告警 + 回滚预案」一起交付,而不是「先上线,出问题再说」。mcp-hub 是团队共享的,一次没预案的事故,影响的是全员。生产级交付 = 功能交付 + 运维预案一起交。


小结

  1. 交付:可重复、可回滚(脚本化 + 锁版本)
  2. 监控:用量、错误、性能,主动看到
  3. 告警:出问题主动通知,别等用户报
  4. 运维三铁律:谨慎、人工确认、有记录
  5. mcp-hub 的交付 = 功能 + 运维预案一起交

下一节,讲项目复盘与经验沉淀。