运维
从日常检查开始,安全地监控、备份、扩缩容和升级 WuKongIM。
如果你是第一次负责 WuKongIM,先不要急着研究所有指标和集群名词。日常运维最重要的是三件事:确认服务能接收流量、确认异常有人知道、确认数据真的能恢复。
单节点也按集群管理
即使只运行一个节点,它也是单节点集群。不要手工绕过 Manager、Controller 或 Slot 修改数据。WuKongIM 固定使用 256 个物理哈希槽,增减节点不会改变这个数量。
第一次运维先完成这三项
- 请求每个节点的
/readyz。返回 HTTP 200 才表示该节点现在可以接收业务流量。 - 为就绪失败、错误增加、队列积压、磁盘不足设置监控和告警,并明确谁来处理。
- 在 Manager 创建备份计划,执行“测试存储”,再确认至少有一个完整且验证成功的备份。
完成这三项后,再根据任务阅读下面的页面。
你现在要做什么
使用 Manager
登录管理后台,查看节点和任务,安全执行管理操作。
检查服务是否正常
看懂 /healthz、/readyz、指标和告警。
增加或移除节点
让新节点接手数据,或安全排空旧节点。
备份与恢复数据
创建可验证的备份,并在维护窗口中恢复。
升级版本
先确认版本兼容,再选择滚动升级或停机升级。
v2 → v3 离线迁移
使用 wkcli migrate 迁移冷备,验证数据并切换客户端。
排查故障
从现象开始,用最少的检查逐步定位问题。
所有变更都按这五步做
| 步骤 | 要做什么 | 什么情况可以继续 |
|---|---|---|
| 1. 记录现状 | 保存版本、配置、节点状态、/readyz 和关键指标 | 知道变更前是什么样 |
| 2. 准备退路 | 准备回滚方法、负责人和停止条件 | 出错时知道由谁、怎么停 |
| 3. 小步执行 | 一次只改一项;多节点时一次只推进一个节点或一小批任务 | 当前步骤已经结束 |
| 4. 验证业务 | 测试登录或重连、消息发送、接收和历史消息 | 业务正常且节点重新就绪 |
| 5. 保存结果 | 保存任务结果、错误、指标和最终节点清单 | 后续能查清做过什么 |
出现这些情况就停手
/readyz返回 503,或节点反复进入和退出就绪状态;- Manager 中的节点、Controller、Slot、Channel 或任务状态缺失、过期或互相矛盾;
- 上一个扩缩容、恢复或升级任务还没有结束;
- 生产变更没有回滚办法,或备份从未验证成功;
- 发布说明没有明确回答当前版本能否与目标版本混合运行。