高可用巡检、重启与故障演练
# 先做静态巡检
进入 系统设置 → 高可用管理,确认平台基础和集群服务没有“需要处理”。

| 能力 | 页面检查 | 数据面检查 |
|---|---|---|
| Ambari Server | 当前节点、备用节点、接替就绪 | 页面/API 可访问,新任务可提交。 |
| HDFS | 2 个 NameNode、JournalNode、ZKFC 正常 | 创建、读取、删除测试文件。 |
| YARN | 2 个 ResourceManager,角色唯一 | 提交短作业并读取状态。 |
| Ranger | 2 个 Admin,统一策略入口生效 | 允许/拒绝策略和审计正确。 |
| Knox | 2 个 Gateway,统一入口生效 | Web/API、LDAP、Kerberos 均可访问。 |
巡检时继续打开 HDFS 与 YARN 的管理页,确认逻辑名称、实例数和当前保护状态;不要只看总览卡片。


# 全服务重启后的验收
通过 Ambari Plus 页面执行 重启全部服务。完成后不要只看任务绿色结束,继续检查:
hdfs haadmin -getAllServiceState
yarn rmadmin -getAllServiceState
hdfs dfs -mkdir -p /tmp/ha-acceptance
hdfs dfs -put /etc/hosts /tmp/ha-acceptance/hosts
hdfs dfs -cat /tmp/ha-acceptance/hosts | head
yarn application -list
1
2
3
4
5
6
2
3
4
5
6
在 Kerberos 环境先使用测试 Principal 取票;不要复用 KDC 管理账号。
# 单节点故障演练
每次只处理一个角色,恢复并收敛后再做下一项:
- Ambari Server Active。
- HDFS Active NameNode。
- YARN Active ResourceManager。
- 一个 Ranger Admin。
- 一个 Knox Gateway。
每项记录故障开始时间、角色接替时间、统一入口恢复时间和数据面结果。演练后还要确认原节点恢复为正确角色,没有双 Active、长期落后副本或仍被负载均衡选中的坏节点。
Ambari Server 演练前先打开接替准备度页面。只有 Agent、证书、备用成员和冲突操作全部允许接替时,才进入维护窗口停止当前 Active。

# 验收记录模板
| 能力 | 故障节点 | 接替时间 | 页面结果 | 数据面结果 | 恢复结果 |
|---|---|---|---|---|---|
| Ambari Server | |||||
| HDFS | |||||
| YARN | |||||
| Ranger | |||||
| Knox |
所有故障演练必须在维护窗口执行。没有完成数据面验证时,只能说明页面状态正常,不能宣布高可用闭环。