1.
总体评估框架:目标、指标与优先级
设备可用性要求(SLA)要明确,通常99.95%或更高。
定义业务重要性(例如电商、支付、API服务)并分级划分恢复优先级。
确定RPO(最大可接受数据丢失)与RTO(恢复时间目标),例如RPO=5分钟,RTO=15分钟。
列出评估指标:机房断电恢复时间、网络切换时间、链路丢包率、磁盘I/O延迟等。
准备评估表和测试计划,包括台风、停电、链路故障与DDoS演练场景。
2.
电力与制冷冗余:N+1、2N与实际考察点
检查UPS配置:是否为2N或至少N+1,电池容量与自动切换时延应量化(例如切换<100ms)。
查看发电机与燃料保障:是否能持续运行72小时以上,切换自动化并有定期启动测试记录。
制冷系统(CRAC/Chiller)是否冗余,重点为管路双路供给与楼层隔离,防止单点故障。
机房供电回路是否分为A/B两路并且服务器机柜采用双电源PDUs连接不同路由。
物理巡检记录、温湿度报警与受台风影响的楼层选型(建议机房地面以上并有地下水位防护)。
3.
网络与链路冗余:多运营商与BGP Anycast策略
机房二区应至少接入2家以上不同骨干运营商,且下行链路物理路径分离。
查看BGP多宿主配置、路由收敛时间与是否支持BGP Flowspec用于快速DDoS策略下发。
上游带宽与端口数量示例:2×10Gbps到运营商A,2×10Gbps到运营商B,自动流量切换。
部署Anycast DNS与Anycast CDN节点可缩短故障切换时间并提升抵抗大规模DDoS能力。
测试点:链路中断时的RTO测量、丢包率、时延抖动与会话保活能力(如TCP会话迁移能力)。
4.
存储与数据库冗余:复制策略与快照频率
推荐的数据库拓扑示例:MySQL主从半同步 + 多活读写架构或分片;备库跨物理机房(A区/B区)。
备份频率示例:事务日志每1分钟,完整备份每日一次,增量备份每4小时。RPO示例:5分钟。
使用快照(LVM/ZFS/云快照)与异地复制,快照保留周期示例:7天滚动保留,月度归档3个月。
存储冗余硬件示例:RAID10、双控制器SAN,后端连接至少双通道10GbE或16Gb FC。
定期做恢复演练,记录从备份中恢复到可用状态所需时间并优化脚本与自动化流程。
5.
CDN与DDoS防护:容量、策略与演练
选择CDN与清洗服务时,核实清洗中心峰值防御能力(例如≥100Gbps或按需扩容)。
DDoS检测策略需结合流量基线、自动速率限制与黑洞/清洗切换;开启BGP Flowspec规则。
域名与DNS策略:权威DNS使用Anycast + 次级DNS分布在不同区域,设置较低TTL以便切换(例如TTL=60)。
示例防护:在峰值攻击时将流量导向清洗厂商,清洗后回流原网点,切换时间控制在1-3分钟。
定期进行DDoS演练(模拟SYN/UDP放大/HTTP高并发),记录业务降级与恢复路径。
6.
服务器与虚拟化配置示例:实机与VPS比较
物理机样例配置:2×Intel Xeon Silver 4214, 128GB DDR4, 4×1.92TB NVMe(RAID10), 2×10GbE。
VPS样例配置:4vCPU, 8GB RAM, 100GB SSD, 1Gbps共享带宽,定期快照与异地备份(每天)。
高可用负载示例:两台前端LB(HAProxy+keepalived VRRP),后端至少3台应用服务器做无状态扩缩容。
状态存储与会话管理示例:使用Redis集群做会话共享,Redis主从+哨兵,持久化RDB/AOF配置。
监控与告警:Prometheus+Grafana,设置SLA阈值告警(CPU>85% 5分钟、丢包>1% 1分钟)。
7.
真实案例:某香港金融SaaS在机房二区的抗灾实践
背景:某香港SaaS在机房二区部署核心交易系统,SLA要求99.99%,RPO=1分钟,RTO=10分钟。
采取措施:双机房Active-Passive跨机房复制,BGP多宿主、Anycast DNS与CDN前置,清洗带宽≥200Gbps。
硬件配置:主库物理机2台(双控制器SAN),从库跨城区冷备3台,网络为4×10Gbps多路径。
演练与效果:台风引发区域停电时,UPS+发电机开启,网络自动在45秒内切换到备路,业务未出现数据丢失。
教训与优化:发现日志聚合瓶颈后加装独立日志集群与异地归档,将RTO从20分钟降至8分钟。
8.
检查清单与推荐流程:从现场验证到定期演练
现场检查:确认双路供电、机柜双电源接入、UPS测试记录与发电机燃料记录。
网络验证:BGP路由表、运营商链路物理路径分离、链路故障时的收敛时间实测。
备份与恢复测试:从备份中恢复数据库并验证完整性;统计恢复所需时间与步骤。
安全与合规:确保防火墙策略、入侵检测与日志保留策略满足行业合规要求(如PCI/DSS视情形)。
制定季度演练计划,包含停电、链路切换、DDoS演练与数据恢复,并记录改进项。
| 组件 |
推荐冗余 |
示例指标 |
| 电力 |
2N或N+1 UPS + 发电机 |
UPS切换<100ms,发电机72小时燃料 |
| 网络 |
多运营商BGP Anycast |
2×10Gbps到A,2×10Gbps到B,清洗≥100Gbps |
| 存储 |
RAID10 + 异地备份 |
每日全备、每4小时增量、日志每1分 |
| 数据库 |
主从+半同步+跨房热备 |
RPO≤5min,RTO≤15min |
| 安全 |
防火墙+DDoS清洗+监控 |
清洗响应1-3分钟,监控5s采样 |
来源:如何评估香港机房二区的抗灾能力 冗余与备份设计要点