WuKongIM Docs

运维

从日常检查开始,安全地监控、备份、扩缩容和升级 WuKongIM。

编辑此页报告文档问题

如果你是第一次负责 WuKongIM,先不要急着研究所有指标和集群名词。日常运维最重要的是三件事:确认服务能接收流量、确认异常有人知道、确认数据真的能恢复

单节点也按集群管理

即使只运行一个节点,它也是单节点集群。不要手工绕过 Manager、Controller 或 Slot 修改数据。WuKongIM 固定使用 256 个物理哈希槽,增减节点不会改变这个数量。

第一次运维先完成这三项

  1. 请求每个节点的 /readyz。返回 HTTP 200 才表示该节点现在可以接收业务流量。
  2. 为就绪失败、错误增加、队列积压、磁盘不足设置监控和告警,并明确谁来处理。
  3. 在 Manager 创建备份计划,执行“测试存储”,再确认至少有一个完整且验证成功的备份。

完成这三项后,再根据任务阅读下面的页面。

你现在要做什么

所有变更都按这五步做

步骤要做什么什么情况可以继续
1. 记录现状保存版本、配置、节点状态、/readyz 和关键指标知道变更前是什么样
2. 准备退路准备回滚方法、负责人和停止条件出错时知道由谁、怎么停
3. 小步执行一次只改一项;多节点时一次只推进一个节点或一小批任务当前步骤已经结束
4. 验证业务测试登录或重连、消息发送、接收和历史消息业务正常且节点重新就绪
5. 保存结果保存任务结果、错误、指标和最终节点清单后续能查清做过什么

出现这些情况就停手

  • /readyz 返回 503,或节点反复进入和退出就绪状态;
  • Manager 中的节点、Controller、Slot、Channel 或任务状态缺失、过期或互相矛盾;
  • 上一个扩缩容、恢复或升级任务还没有结束;
  • 生产变更没有回滚办法,或备份从未验证成功;
  • 发布说明没有明确回答当前版本能否与目标版本混合运行。

停止后先保存现场,再按故障排查收集证据。命令行工具见服务端工具

本页内容