不要惊慌!管理重大 IT 事件的 10 种方法

· 04分钟阅读

实施重大事件管理流程

应根据紧急程度、影响和严重性评估事件

对许多 IT 部门来说,面对重大事件的默认反应是进入火灾扑救模式。以下是解决重大事件的十个最佳实践步骤——无需惊慌失措。

第一步:区分高优先级事件和重大事件

重大事件是指对多个用户产生巨大业务影响并迫使组织偏离现有事件管理流程的任何问题。

由于缺乏明确的 ITSM 指南,高优先级事件常被错误识别为重大事件。为避免混淆,应根据紧急程度、影响和严重性等因素区分高优先级事件和重大事件。

第二步:制定清晰且独立的重大事件工作流程

为了快速恢复中断的服务,应实施健全的流程,并为重大事件设立独立的工作流程。

重点自动化和简化流程,包括:识别重大事件;与受影响的员工或业务利益相关者沟通;分配合适人员;跟踪重大事件的整个生命周期;在违反 SLA 时升级;解决和关闭事件,以及生成和分析报告。

为确保尽快解决,采用无审批流程处理重大事件。

第三步:派遣最佳团队处理

确保最佳资源参与重大事件处理,明确角色和职责。有些组织设有由重大事件经理领导的专门重大事件团队,另一些则组建由各部门专家组成的动态临时团队。

您的主要目标必须是保持资源的投入,避免时间和优先级冲突。

第四步:培训并配备员工合适的工具

无人能预测重大 IT 事件何时发生,但处理的第一步是做好准备。将重大事件管理团队划分为子团队,并对其进行重大事件管理培训。通过技能与需求匹配分配职责。

定期进行模拟测试,以识别优势、评估绩效并根据需要弥补不足。这也将帮助团队应对压力,并为面对 实时场景 做好准备。

为团队配备合适的工具,如具备无缝连接的智能手机和平板电脑,以便在紧急情况下随时随地工作。

第五步:遵循预定义的 SLA 并准备额外资源待命

为重大事件定义严格的 SLA。设立独立的响应和解决 SLA,并为流程违规设置明确的升级点。如果指定技术人员缺乏解决事件的专业知识,遵循手动升级流程,并确保始终有备份技术人员可用。

第六步:保持相关人员知情

重大事件生命周期 中,向相关利益相关者发送公告、通知和状态更新。自助门户中的公告可防止最终用户重复提交工单,避免帮助台过载。

在重大事件导致服务中断期间,还应每小时或每两小时发送更新。设立专线以立即响应重大事件并为利益相关者提供支持。使用最快的通信方式,如电话、直接访问、实时聊天和远程桌面控制,而非依赖电子邮件。

第七步:审查重大事件以避免未来重复发生

重大事件解决后,使用 问题管理方法 进行根本原因分析。然后,按照 变更管理流程 实施全组织范围的变更,以防止类似事件再次发生。

通过使用 资产管理 提供涉及资产的详细信息,加快整个事件、问题和变更管理流程。

第八步:将重大事件情报添加到知识库

制定简单的知识库文章模板,捕捉关键细节。这些可能包括文章涉及的重大事件类型、最新解决的问题、文章所有者以及实施解决方案所需的资源。为重大事件单独创建和跟踪解决方案,以便快速轻松访问。

第九步:审查并报告重大事件

记录并分析所有重大事件,以识别改进领域。这将帮助团队更有效地处理未来类似问题。同时,生成针对重大事件的专门报告,用于分析、评估和决策。

这些报告可能包括:每月提出和关闭的重大事件数量;重大事件的平均解决时间;重大事件导致的停机百分比;以及与重大事件相关的问题和变更。

第十步:评估重大事件流程以实现持续服务改进

最佳实践是记录重大事件流程和工作流程,供 IT 及其他业务利益相关者随时参考。这可能包括参与人员数量、角色和职责、沟通渠道、用于修复的工具、审批和升级流程、整体策略以及响应和解决的基线指标。

管理层必须定期评估流程,以检查重大事件管理是否达到预期绩效水平。这有助于纠正缺陷并促进持续的服务改进。

本文最初发表于 Information Age。

关于作者

Prithiv RajKumar市场分析师

注册我们的通讯,获取更多优质内容

在您的收件箱获取最新内容

点击‘keep me in the loop’即表示您同意根据隐私政策处理个人数据。
让我们一起支持更快、更简单的方式