根据 Statista,"全球创建、捕获、复制和消费的数据总量预计将快速增长,2020年达到64.2泽字节。在未来五年直到2025年,全球数据创建预计将增长到超过180泽字节。"
在混合业务环境中,数据已成为贸易、增长和成功的核心商品。分散的访问、对性能下降的容忍度降低以及对可扩展性的需求增加,已把 磁盘空间监控 放在许多组织服务器管理策略的核心位置。
同一份 Statista 报告指出,"随着数据量的强劲增长,存储容量的安装基础预计将增加,在2020年至2025年的预测期间,复合年增长率达到19.2%。"
数据使用量的增加使得监控磁盘利用率对组织来说非常重要,以确保磁盘空间可用性,最大限度减少意外停机风险,并防止服务器延迟。磁盘空间监控工具能够帮助您设定监控阈值,并在磁盘空间可用性超出设定阈值时触发警报,保证终端用户持续高效工作,同时帮助管理员预测并执行磁盘容量规划、升级和维护。
然而,企业级的磁盘空间监控不仅仅是盯着性能图表和数字。您需要关注一个长期的业务策略,考虑所有相互关联和潜在的磁盘空间消耗因素。同时,您还需要更深入了解业务运营,以便对网络中的磁盘利用率有一个统一视图。
此过程的复杂性导致了一些挑战,如果不适当解决,长期会带来不利影响。以下是磁盘空间监控中的主要挑战。


识别服务器或任何设备的名义磁盘空间使用基线十分困难,因为理想的磁盘利用率在不断变化。您认为今天安全的磁盘利用率可能明天就会使您的网络面临风险。磁盘空间使用会根据不同的业务场景变化,比如使用频率、终端用户的使用模式以及服务器类型(本地或全球)。
例如,考虑一个电子商务业务,其中SQL服务器上的名义磁盘利用率基线默认设置为70%。但当某些特定日期或产品进行闪购时,注册和订单数量会激增。
技术上讲,I/O请求的增加会影响服务器的磁盘利用率,导致在促销期间服务器磁盘使用超过基线,促销结束后低于基线。这可能导致I/O延迟并影响网络性能。
因此,在设定基线之前,您需要:
提示:为了管理服务器上突发过载的数据,您可以将阈值设定在名义基线稍低的位置,以便随时做好准备。
磁盘空间并非单一用途。它受其他相关因素的影响,如运行在服务器上的应用程序、进程和服务出现问题,最终导致异常的磁盘空间消耗。
想知道如何吗?让我们再看一个例子。当您在服务器上运行一个带有错误或漏洞的高端应用程序时,它比平时消耗更多磁盘空间以保证流畅运行。这会迅速增加磁盘空间使用。在这种情况下,进行手动设备清理或扩展磁盘空间无济于事,因为故障并非由磁盘空间问题引起,而是由设备上运行的进程或应用程序产生的虚假峰值。除非修复漏洞或停止应用程序运行,否则无法解决问题。
因此,仅监控磁盘空间是不够的。在出现故障时,您可能会忽略相关因素,最终错误地判断故障是由磁盘空间不足造成的。
为了克服这个挑战,您需要:

运行高性能应用程序以支持其业务功能的组织通常在高磁盘利用率环境中运作。这要求网络管理员持续监控网络设备的磁盘空间,并在出现异常使用模式时采取适当措施,包括硬件升级。
在硬件升级方面,最大的挑战之一是确保现场系统与监控工具之间硬件配置的一致性。这通常因为现场团队和监控团队之间存在沟通障碍,影响他们的工作效率,并增加故障发生时的平均解决时间(MTTR)。
例如,现场硬件团队为设备X、Y和Z升级了硬盘,但忘记通知监控团队。如果设备X、Y和Z随后发出磁盘空间问题警报,网络管理员将不了解新升级的磁盘容量。管理员在发现磁盘已升级、磁盘空间不成问题之前,可能会浪费一些时间解决问题。
为避免此类问题,应建立一个系统来:
服务器的磁盘使用量可能因与其拓扑互联的其他设备(如路由器或交换机)故障或失效而增加。判断故障是否因磁盘空间不足或依赖设备失败,需要更宏观的视角,这往往需要时间、资金和精力。但付出这些代价可防止因磁盘空间过度使用造成的停机和潜在业务损失。
简言之,由于服务器的磁盘性能也依赖其依赖设备,设备出现故障将最终影响服务器的磁盘利用率。当您明确设备与服务器的依赖关系时,您将获得网络架构的清晰图景,并定位性能瓶颈的根源。
因此,为了实现成功的磁盘监控策略,您需要:

分析磁盘空间消耗如何随着 业务趋势 变化,有助于网络管理员为短期设定磁盘空间监控阈值,但由于磁盘空间使用的动态性,这对长期规划帮助有限。
例如,您可能基于某周的磁盘空间使用模式为服务器设置阈值,但下周或几个月后的使用模式可能大不相同。比如用户可能工作日访问数据库频繁,周末较少,第一季度运行关键流程,之后处理低优先任务等。各业务不同,这些因素共同影响磁盘数据增长趋势。
这里,由于缺乏对增长趋势的长期关注,确定理想监控基线十分困难。为了进行长期分析:
以下是我们总结的磁盘空间监控挑战及其解决方案简要回顾:
点击了解更多关于 OpManager 的先进
磁盘空间监控功能 。 新用户?安排
个性化演示 或下载我们的30天免费试用版
感谢您的反馈!