弹性是指网络处理中断并继续以可接受的标准向用户提供服务的能力。网络运营可能会受到配置错误、断电或操作员失误等问题的威胁。当发生此类情况时,最终用户将无法访问网络,这会对组织产生负面影响。高度弹性的网络可以通过在网络中断时恢复网络运营来防止这种情况发生。
现代IT组织几乎没有停机时间的余地。Gartner计算出组织每小时停机约损失 $300,000 ,其他研究甚至认为该数字偏低。停机会从两个层面影响业务:业务中断导致的实际损失,以及经常被忽视的声誉损失;毕竟,人们讨厌看到蓝色错误屏幕或丢失所有输入的信息。
为了应对这一点,公司在SLA中提供越来越优越的条款;例如,网络运营的可用性达到了五个九,即99.999%的正常运行时间。这样每天的停机时间约为一分钟。如此高的标准只能通过高度弹性的网络基础设施来实现。
保证持续网络运营的一种方法是设置故障转移机制,这被称为网络冗余。冗余网络拥有多个能够执行相同操作的设备。当其中一个设备宕机时,另一个设备会接管其工作并恢复正常的网络操作。
例如,防火墙设置了与其保护网络的多个连接。次级防火墙会定期接收初级防火墙的健康报告。当一定时间内未接收到报告时,次级防火墙认为初级防火墙宕机,并接管其功能。次级防火墙接管主防火墙功能的时间称为切换时间。
尽管冗余是防止停机的直接方法,弹性则更为复杂。它侧重于恢复网络运营,而非完全替换之。网络每天都会遇到各种大大小小的问题。为所有问题规划冗余既困难又昂贵。我们可以通过缩短故障识别和解决时间来绕过这个问题。
高可用性: 这是一种通过立即切换到故障转移来最大程度减少停机时间的冗余类型。例如,高可用性路由器频繁检测其主设备状态。当发生故障时,它们会接管操作。

容错: 有时主设备可能已失败,而次级设备检测状态并接管之间存在延迟。此期间用户输入的信息可能会丢失。容错系统通过让主设备和次级设备共享负载来消除这一延迟。两个设备相互检查状态。当其中一个失败时,另一个承载全部负载。这样,即使操作受限,网络也不会完全宕机。

复制: 网络复制是一种通过即时将所有数据从主设备镜像到次级设备来实现冗余的方法。主、次服务器将保持同步,数据丢失将降至最低。
单点故障: 该术语指网络中的一个脆弱点,可能导致整个网络运营中断。可能是网络所在的防火墙、负载均衡器,或连接至WAN的电缆线。网络管理员应尽力消除单点故障。
停机通常有三种原因。已知原因是指您知道并能规划的原因。维护和升级就属于此类。您可以安排这些操作,避免对网络运营产生重大影响。
其次是“已知的未知”原因。这类原因无法预先计划,但您知道出现时应从哪里寻找答案以及如何修复。包括配置错误、人为失误、设备故障或网络中断。必须迅速找到问题原因并解决。
最后是“未知的未知”原因。这类事件超出您的控制范围,如飓风、洪水、雷击或人为灾害。应对“未知的未知”的最佳方法是将数据存储在多个地点、云存储或数据中心。
使网络停机成为不可能是困难的。即使严格遵循标准和指导,也可能出现一些无法避免的问题。尽管如此,做好准备总是有帮助的。这里列出了一些可遵循的建议和措施,以提升您的网络基础设施弹性。
使用 网络监控工具 监控网络是保护网络免受停机威胁的最安全方法。这样您可以提前发现网络问题,主动修复。
OpManager 是一款网络监控工具,监视网络中的所有组件,并就任何异常生成实时警报。如此深入的网络可见性无疑非常有帮助。但OpManager更进一步,凭借其先进的故障识别和解决功能提升网络弹性。
自适应阈值: OpManager的机器学习驱动 自适应阈值 通过消除误报和警报泛滥,帮助您优化故障排除。OpManager会在三天的训练期内学习您的正常网络性能,随后针对该时段的网络活动设置每小时阈值。

自动化工作流程: 通过自动化基础故障排除操作提升网络弹性。您可以创建 工作流程 来执行如重启已停止服务、清理冗余警报、检查设备响应情况以及执行脚本等操作。

根因分析: 一旦发生故障,尽快找出原因至关重要。OpManager的 根因分析 配置文件帮助您关联最多20个实体的数据,追踪故障根本原因。

这只是冰山一角。OpManager配备大量其他功能和工具,助您提升网络抗停机能力。 下载OpManager 或试用我们的30天免费试用版,体验不同之处。
感谢您的反馈!