指标是 IT 服务管理 的核心,提供运营洞察并帮助识别持续改进的领域。常见的服务台指标有助于展示内部运营效率。例如,SLA 衡量在规定时间内解决的工单数量,是展示服务台效率的关键因素。另一方面,故障指标帮助团队识别 IT 基础设施中的薄弱环节,并评估对故障事件的响应。这有助于 IT 团队将故障对关键系统造成的连锁反应降到最低。

需要跟踪的关键故障指标有哪些?本文将介绍以下三个 KPI:

  • 平均故障间隔时间
  • 平均故障时间
  • 平均修复时间

平均故障间隔时间 (MTBF)

平均故障间隔时间(MTBF)含义

当 IT 基础设施资产(无论是网络、服务器、工作站等)频繁发生故障时,会对 IT 和业务服务的可用性产生连锁影响。这些中断会导致收入和声誉的损失。如果某个 IT 资产频繁停机,通常需要维修或更换。在此之前,调查并了解资产为何频繁故障及其发生的环境非常重要。这有助于规划资产维护并提升系统可用性。MTBF 是帮助识别停机原因的指标,有助于缓解问题或规划快速恢复,从而提高 IT 系统的可用性。

MTBF 指标及计算

图 1. 平均故障间隔时间

如果某个 IT 资产的 MTBF 较低,意味着该资产频繁停机,导致 IT 和业务中断。

MTBF 示例

在某组织中,每当应用新的 Windows 固件更新时,存储驱动器的新更新总是失败。此情况发生了几次,MTBF 变得更差。经过分析,团队确定第三方驱动程序导致执行更新所需的 API 未被实现或存在缺陷。当计划新更新时,如果第三方驱动未实现必要的 API,有两种解决方案可供选择。用 Windows 替代 SATA 和 NVMe 存储协议的 API,或从 OEM 获取新版本且支持更好的驱动程序,以帮助实现更新、修复漏洞并关闭安全漏洞。监控和跟踪驱动程序升级及停机时间有助于提升存储驱动器的可用性。

如何提高 MTBF

  • 实施观察资产健康状况的流程,以跟踪和监控故障。这有助于识别中断原因。
  • 分析问题根本原因,提升意识,解决长期原因,改善资产性能。
  • 制定快速响应策略,有效应对并减少影响运营的停机时间。目标是实现更少且间隔更长的中断。

平均
故障时间 (MTTF)

平均故障时间(MTTF)含义

资产频繁故障可能中断组织的 IT 运营,导致 IT 基础设施性能下降和表现不佳。MTTF 指标帮助确定资产、设备或组件的典型寿命。对于 MTTF 较低的 IT 资产和组件,通常更节省时间且减少运营影响和成本的做法是更换组件,而非修复。

这尤其适用于与基础设施关键运营元素相关的 IT 组件,如大型主机服务器堆栈或网络接入点。

MTTF 公式及计算

图 2. 平均故障时间

如果资产的 MTTF 不理想且频繁故障,表明该 IT 资产不可靠,需要频繁更换以避免影响 IT 运营。

MTTF 示例

在一家 IT 软件开发公司,当数据和网络服务器堆栈中的交换机连接或断开电缆时,网络电缆会松动、断开或损坏,导致数据传输中断,文件损坏。网络团队进一步分析发现,CAT6 RJ45 补丁电缆的防卡扣塑料罩经常断裂,原因是电缆采购自使用廉价材料的制造商。IT 团队随后用更高质量的电缆替换旧电缆,以确保未来移动电缆时不会出现数据丢失或损坏等问题。这是一个典型示例,但定期跟踪电缆的 MTTF 有助于 IT 团队了解关键资产(如组件)的影响,从而做出有关维修和更换的明智决策。

如何延长 MTTF

  1. 通过采购高质量资产并淘汰低质量低成本资产来延长资产寿命。
  2. 通过定期检查与关键资产相关的组件,防止业务运营的大规模中断。
  3. 实施准时库存流程,估算资产的运行时间,从而降低资产存储的管理成本。

平均
修复时间 (MTTR)

平均修复时间(MTTR)含义

当关键 IT 系统发生故障时,IT 团队必须尽快恢复系统运行。恢复 IT 系统的延迟可能导致收入损失并影响关键业务运营。一个组织良好的恢复和响应系统可以帮助 IT 团队应对计划外停机并有效恢复运营。MTTR 衡量修复或排查资产并恢复其运行能力所需的平均时间。

MTTR 计算

图 3. 平均修复时间

随着 MTTR 增加,停机成本也会增加。高 MTTR 表明您的恢复和响应操作不够快速和有效。系统故障不可避免,但 MTTR 使团队能够及时且有策略地应对资产故障。

MTTR 示例

一家软件公司因代码漏洞遭遇零日攻击,影响其开发的视频游戏。攻击中断了 Wi-Fi 和监控系统,导致攻击者访问了组织的网络域和机密业务文件。网络安全团队通知员工有关零日攻击的信息及报告渠道。组织内所有 IT 资产均配备了下一代防病毒 (NGAV)。攻击禁用了局域网和员工自助门户,严重影响了组织运营。攻击发生一小时内,网络安全团队通过 NGAV 利用威胁分析和用户行为模式识别了可疑活动,并立即运行补丁管理脚本修复代码漏洞,同时锁定本地网络,防止进一步影响运营和数据泄露。

如何减少 MTTR

  1. 高效的 资产管理策略 通过识别瓶颈,指导资产维修或更换,帮助做出更好的决策,节省资金和存储空间。
  2. 明确定义技术人员的职责和角色,以简化事件检测和解决流程。
  3. 为技术人员提供详细的标准操作程序,减少停机期间的误解和混乱。
  4. 使用企业资产管理解决方案测量 MTTR,该方案集中管理资产维护和监控信息,有助于优化资产利用率、收集资产数据并预测可能的停机。

结论

MTBF 和 MTTR

这些故障指标帮助团队识别运营瓶颈及其对事件的响应能力。它们使 IT 团队能够通过定位持续事件的根本原因,实现更高的运营效率。IT 团队可以通过清晰了解 IT 运营受影响的领域,改进事件响应策略。这些指标应作为 KPI 在组织中实施,而不仅仅是绩效目标。指标指出流程简化和运营改进的方向,而非单纯的达标目标。

各指标的简要总结:

  • MTBF 提供了更深入的洞察,帮助评估您的服务台在防止未来中断方面的有效性。
  • MTTF 帮助您了解资产的生命周期及其可靠性。
  • MTTR 表示维修所花费的时间以及您的 IT 团队诊断中断的速度。
Saket

关于作者

Saket Pasumarthy 是 ManageEngine ServiceDesk Plus 的产品专家,是 ITSM 爱好者,热衷于了解 IT 领域的最新进展。Saket 撰写文章和博客,帮助全球 IT 服务管理团队应对服务管理挑战。他还在 ServiceDesk Plus 大师班系列中进行用户教育讲座。Saket 业余时间喜欢踢足球和在飞行模拟器上驾驶飞机。

常见问题解答

使用我们的工具包快速评估您的 IT 事件管理实践

  • 一项自评分评估,用于衡量您从事件识别到关闭的核心事件管理实践
  • 一份检查表,用于审查您的团队在混合工作环境中应对重大事件的准备情况
  • 一份备忘单,帮助克服混合工作模式下常见的事件管理挑战

您今年是否计划更换 ITSM 工具?*

点击‘下载工具包’即表示您同意根据隐私政策处理个人数据。
让我们一起支持更快、更简单的方式