什么是网络弹性?

弹性是指网络处理中断并继续以可接受的标准向用户提供服务的能力。网络运营可能会受到配置错误、断电或操作员失误等问题的威胁。当发生此类情况时,最终用户将无法访问网络,这会对组织产生负面影响。高度弹性的网络可以通过在网络中断时恢复网络运营来防止这种情况发生。

弹性在现代IT组织中的重要性

现代IT组织几乎没有停机时间的余地。Gartner计算出组织每小时停机约损失 $300,000 ,其他研究甚至认为该数字偏低。停机会从两个层面影响业务:业务中断导致的实际损失,以及经常被忽视的声誉损失;毕竟,人们讨厌看到蓝色错误屏幕或丢失所有输入的信息。

为了应对这一点,公司在SLA中提供越来越优越的条款;例如,网络运营的可用性达到了五个九,即99.999%的正常运行时间。这样每天的停机时间约为一分钟。如此高的标准只能通过高度弹性的网络基础设施来实现。

冗余与弹性

保证持续网络运营的一种方法是设置故障转移机制,这被称为网络冗余。冗余网络拥有多个能够执行相同操作的设备。当其中一个设备宕机时,另一个设备会接管其工作并恢复正常的网络操作。

例如,防火墙设置了与其保护网络的多个连接。次级防火墙会定期接收初级防火墙的健康报告。当一定时间内未接收到报告时,次级防火墙认为初级防火墙宕机,并接管其功能。次级防火墙接管主防火墙功能的时间称为切换时间。

尽管冗余是防止停机的直接方法,弹性则更为复杂。它侧重于恢复网络运营,而非完全替换之。网络每天都会遇到各种大大小小的问题。为所有问题规划冗余既困难又昂贵。我们可以通过缩短故障识别和解决时间来绕过这个问题。

一些与网络冗余和弹性相关的术语

高可用性: 这是一种通过立即切换到故障转移来最大程度减少停机时间的冗余类型。例如,高可用性路由器频繁检测其主设备状态。当发生故障时,它们会接管操作。

容错: 有时主设备可能已失败,而次级设备检测状态并接管之间存在延迟。此期间用户输入的信息可能会丢失。容错系统通过让主设备和次级设备共享负载来消除这一延迟。两个设备相互检查状态。当其中一个失败时,另一个承载全部负载。这样,即使操作受限,网络也不会完全宕机。

 

复制: 网络复制是一种通过即时将所有数据从主设备镜像到次级设备来实现冗余的方法。主、次服务器将保持同步,数据丢失将降至最低。

单点故障: 该术语指网络中的一个脆弱点,可能导致整个网络运营中断。可能是网络所在的防火墙、负载均衡器,或连接至WAN的电缆线。网络管理员应尽力消除单点故障。

如何规划停机时间?

停机通常有三种原因。已知原因是指您知道并能规划的原因。维护和升级就属于此类。您可以安排这些操作,避免对网络运营产生重大影响。

其次是“已知的未知”原因。这类原因无法预先计划,但您知道出现时应从哪里寻找答案以及如何修复。包括配置错误、人为失误、设备故障或网络中断。必须迅速找到问题原因并解决。

最后是“未知的未知”原因。这类事件超出您的控制范围,如飓风、洪水、雷击或人为灾害。应对“未知的未知”的最佳方法是将数据存储在多个地点、云存储或数据中心。

7条提高网络弹性的小贴士

使网络停机成为不可能是困难的。即使严格遵循标准和指导,也可能出现一些无法避免的问题。尽管如此,做好准备总是有帮助的。这里列出了一些可遵循的建议和措施,以提升您的网络基础设施弹性。

  1. 在组织各层面实现冗余: 冗余通常是提升网络弹性的最佳方法。您可以在组织不同层面实现冗余以最大限度减少中断。在机器层面,可采用冗余处理器、操作系统和数据备份。在设备层面,指的是针对单点故障设备(如路由器)或对网络运营至关重要的设备(如某些服务器)的冗余。在站点层面,可通过数据中心或云存储实现冗余,即使发生大规模断电或自然灾害,也可保证网络持续运行。

 

  1. 消除单点故障: 无论您的安全措施多么先进,单点故障都可能导致系统瘫痪。单点故障常常意外被发现。例如,我们见过网络防火墙的冗余连接共用同一条线路进入大楼。线路问题可能同时击垮主防火墙和冗余防火墙。使用负载均衡器的容错系统也可能失败,因为负载均衡器通常是单点故障。您需要分析网络中的单点故障,并想办法消除它们。

 

  1. 确保电源供应稳定: 断电可能随时发生,持续时间难以预料,且可能完全中断网络运营。因此,发电机和不间断电源是值得投资的设备。需定期在维护时检查不间断电源设备以确保其正常工作。建议同时配备备用发电机,以防主发电机在断电时故障。

 

  1. 定期进行升级和维护: 定期升级和维护是健康且具弹性网络的关键。软件若长期不升级,可能不再受支持,增加运营风险。需定期升级路由器、交换机固件,操作系统,关键软件和反恶意软件软件。还需要定期计划维护,以保持设备状态良好和运行顺畅。

 

  1. 测试备份: 维护期间检查数据备份是否成功且安全是良好实践。停电后发现备份无效是极其令人沮丧且本可避免的。备份频率应根据数据性质调整。重要数据应更频繁备份,以降低数据丢失风险。备份还应储存在远程数据中心,以防遭遇火灾或其他灾害。

 

  1. 确保适当冷却: 设备运行时会产生大量热量。冷却系统用于保持设备温度在可控范围内。必须拥有可靠且独立的冷却系统,能在断电或自然灾害(如暴雨、洪水)期间继续运行。

 

  1. 重要文件遵循适当命名规范: 人为错误常因误删重要文件或密钥引起。通过组织内部执行适当的命名规范可避免此类错误。启用重要文件的软删除功能也有助于恢复文件。

使用OpManager监控网络弹性

使用 网络监控工具 监控网络是保护网络免受停机威胁的最安全方法。这样您可以提前发现网络问题,主动修复。

OpManager 是一款网络监控工具,监视网络中的所有组件,并就任何异常生成实时警报。如此深入的网络可见性无疑非常有帮助。但OpManager更进一步,凭借其先进的故障识别和解决功能提升网络弹性。

 

自适应阈值: OpManager的机器学习驱动 自适应阈值 通过消除误报和警报泛滥,帮助您优化故障排除。OpManager会在三天的训练期内学习您的正常网络性能,随后针对该时段的网络活动设置每小时阈值。

 

自动化工作流程: 通过自动化基础故障排除操作提升网络弹性。您可以创建 工作流程 来执行如重启已停止服务、清理冗余警报、检查设备响应情况以及执行脚本等操作。

 

根因分析: 一旦发生故障,尽快找出原因至关重要。OpManager的 根因分析 配置文件帮助您关联最多20个实体的数据,追踪故障根本原因。

 

这只是冰山一角。OpManager配备大量其他功能和工具,助您提升网络抗停机能力。 下载OpManager 或试用我们的30天免费试用版,体验不同之处。

 

感谢您的反馈!

此内容对您有帮助吗?

很抱歉给您带来不便。请帮助我们改进此页面。

我们该如何改进此页面?
您是否需要有关此主题的协助?
点击“提交”,即表示您同意根据隐私政策处理个人数据。