介绍
随着人工智能在 ITSM 领域的兴起,作为核心 ITSM 实践的事件管理至今仍在不断改进。事件管理的首要目标是尽快恢复常规服务,同时将对生产业务的影响降到最低。但事件工单是如何被记录的,以及它从记录到关闭整个生命周期的推进方式,已经随着技术的发展而发生了变化。
随着组织越来越依赖 IT 基础设施来支撑其核心业务流程,实施有效的事件管理实践变得愈发关键。本指南在充分考虑 ITIL® 建议的前提下,对事件管理进行了全面探讨。
基本概念和定义
要构建一个成功的事件管理流程,首先需要为你的组织制定清晰的“事件”定义,并理解如何评估事件管理的战略重要性。
什么是 IT 事件?
ITIL 将IT 事件定义为“任何影响业务连续性的、对 IT 服务造成的计划外中断或服务质量下降”。事件的范围可以从单个用户问题(例如个人打印机故障),到影响多个部门关键业务运营的企业级系统故障。不同组织的事件范围和复杂性差异很大,因此进行恰当的分类至关重要。
如何对事件进行分类:
| 事件类型 | 影响范围 | 业务影响 | 响应优先级 |
|---|---|---|---|
| 轻微事件 | 单个用户/部门 | 有限的业务影响 | 标准 SLA |
| 重大事件 | 业务关键服务 | 全组织范围中断 | 高优先级 |
| 严重事件 | 完全服务中断 | 严重的业务中断 | 应急预案 |
为什么事件管理很重要?
系统化的事故管理方法能够将被动、混乱的救火式处理,转变为透明、高效的事故解决流程,从而维持客户的信任。这将带来:
- 业务宕机时间减少
- 员工体验改善
- 企业服务透明度提升
- 知识库累积
- 平均解决时间缩短
- 预防严重的业务中断
事件管理不当有哪些风险?
- 缺乏对工单状态和解决进度的可视性,导致员工不满
- 未对事件的解决方案(知识)做积累。导致对已知错误重复排查和解决
- 服务长时间中断,直接影响业务收入
- 普通事件升级为重大中断的可能性增加
事件生命周期

事件生命周期跟踪一个事件从被记录到确认用户对解决方案满意的全过程。该生命周期包括工单记录、初步分类、分派、响应、诊断、解决,以及在用户确认后的关闭。
这种方法包含七个不同的阶段。让我们按顺序逐一介绍。
阶段一:事件识别与全渠道工单反馈
事件生命周期从事件识别开始,这一阶段需要通过多种渠道来实现,组织必须对这些渠道进行有效监控和整合。拥有多种渠道能改善用户提交工单时的体验,让他们以最方便的渠道及时提交工单。
您的 ITSM 应该从以下渠道识别记录工单:
- 提供主动警报的自动化监控系统和监测工具
- 用户的主动反馈,包含 服务台工单、邮件和聊天
- 内部协作工具,例如 企业微信,钉钉,飞书,Slack、Microsoft Teams 和 Cliq
成熟的 ITSM 平台提供全面的全渠道工单功能,将各个渠道的事件工单统一到平台中。而不是由不同人员分别监控各个渠道。这样的方式能确保无论工单来自哪个渠道,都能获得一致的服务交付水准。
现代服务台系统还通过提供服务目录、定制化的自助服务门户 来简化事件提交流程。服务目录包含一系列常见事件的工单模板;自助服务门户能提供 对所有未处理、挂起和已完成工单的统一视图,确保工单高效处理和透明展示。
有效的工单记录通过捕获全面的信息,为成功解决事件奠定基础。通过为技术人员提供必要的背景信息,减少事件的解决时间。
ITSM 与全栈监控工具的集成
现代 ITSM 平台与全栈监控工具集成,可在应用、基础设施和网络层之间提供完整可见性。可将事件的关键绩效指标(KPIs)与应用日志和系统遥测数据自动关联起来,可以自动检测看似无关事件之间的关系,识别重复出现的模式,并提供丰富的上下文信息,从而加速事件诊断和解决。
| 信息类别 | 所需详细信息 | 业务目的 |
|---|---|---|
| 工单跟踪 | 唯一工单 ID、时间戳、来源渠道、分类和优先级 | 跟踪和审计合规 |
| 请求人信息 | 用户详细信息、联系信息、所属部门 | 沟通与升级处理 |
| 技术细节 | 受影响的系统、错误信息、症状 | 根本原因分析(RCA) |
| 业务背景 | 服务影响、受影响流程、紧急性驱动因素 | 优先级排序和资源分配 |
重大事件管理
重大事件被定义为影响大、紧急程度高的事件,会对业务运营、大量用户或关键服务造成严重影响。这些事件需要立即关注,并且针对重大事件的应对策略要超出标准事件管理协议的范围,进行升级处理。
一旦判定为重大事件,应成立一个事件响应团队,由重大事件经理、技术人员、业务代表和沟通协调员组成。该团队必须确保向利益相关者定期提供状态更新,立即执行事件的控制措施。并执行根本原因分析(RCA)和服务恢复,随后还必须安排一次事后事件审查(PIR)。
阶段二:分类与优先级排序
一旦事件被记录,每张工单都必须进行分类和优先级排序,这一过程称为事件分诊(triaging)。这样可以确保影响最大的事件能够及时得到处理。
先进的ITSM平台会在整个事件分诊流程中引入 AI,实现以下自动化:
- 对事件工单进行分析,预测影响范围
- 优先级评估
- 自动关联影响配置项(CI)
- 确定合适的分类和子分类
这在显著减少人工分诊工作量的同时,提高了事件处理的一致性和准确性。这些基于机器学习的算法通过从解决结果和技术人员反馈中不断学习,实现预测准确率的持续提升。大多数组织会根据业务影响或影响的资产,将事件归类到不同的分类和子分类中。

高效,准确的分类可以确保工单分配到对应负责的专业的技术人员手中。确定优先级需要清晰理解 影响 和 紧急度 这两个因素。影响 指的是对业务中断程度以及受影响用户数量的衡量,而紧急度则表示问题对时间的敏感性以及因延迟解决所带来的业务风险。下表称为优先级矩阵。
| 影响/紧急程度 | 低紧急程度 | 中等紧急程度 | 高紧急程度 |
|---|---|---|---|
| 低影响 | P4:次要 | P3:标准 | P2:高 |
| 中等影响 | P3:标准 | P2:高 | P1:严重 |
| 高影响 | P2:高 | P1:严重 | P1:紧急 |
要了解有关 ITIL 优先级矩阵的更多信息,请点击此处。
阶段三:智能分配与路径规划(routing)
接下来,需要将事件分配给合适的技术人员。并优化工单流转路径。 ITSM 平台会利用 AI 和 ML 算法,例如:
- 自然语言处理:对事件描述和关键词进行自动分析
- 情感分析:自动检测用户的挫败感水平,以便升级到合适的技术人员
- 基于技能的路由:将事件匹配给具备相关专业技能且可用的技术人员
- 负载均衡:确保工作负载的公平分配
常用的路由算法:
| 方法 | 使用场景 | 优点 | 注意事项 |
|---|---|---|---|
| 轮询(Round-Robin) | 标准事件 | 工作量分配均衡 | 可能无法考虑事件复杂度 |
| 基于技能(Skill-Based) | 专业性问题 | 实现最佳专业技能匹配 | 需要全面的技能映射 |
| 负载均衡(Load Balancing) | 高容量环境 | 防止技术人员过载 | 配置要求较为复杂 |
阶段四:SLA 管理与升级
服务等级协议(SLA)定义了事件响应和解决的可接受时间范围,为所有利益相关者建立清晰的期望。缺乏对 SLA 的管理会损害客户关系和业务运营。SLA 需要分级,而不是一刀切的通用方案。这样可以确保针对不同优先级提供不同的服务策略,如下例所示:
| SLA 指标 | P1:紧急 | P2:严重 | P3:标准 | P4:缓办 |
|---|---|---|---|---|
| 响应时间 | 15 分钟 | 2 小时 | 8 小时 | 24 小时 |
| 解决时间 | 4 小时 | 24 小时 | 72 小时 | 120 小时 |
| 更新频率 | 每 30 分钟 | 每 4 小时 | 每天 | 按需 |
升级机制可确保在违反服务级别协议(SLA)或标准解决流程不足以解决事件时,事件能够得到更多的关注。
升级类型及其意图:
- 因职能升级,将事件转派至具备专业技能的支持团队处理。
- 因时限升级,为避免违反服务级别协议(SLA),在接近或超过响应/解决时限时自动升级。
- 因影响升级,当业务影响范围超出初始评估时,对事件进行升级。
ITSM 平台提供自动告警关联、自动化以及预测分析,通过主动升级来防止 SLA 违约。要了解更多关于 SLA 的信息,请点击此处。
阶段五:事件诊断与解决
指定的技术人员开始进行诊断,以识别事件的临时变通方案或最终解决方案。此阶段既需要技术专长,也需要结构化的问题解决方法,在恢复服务的同时确保进行了全面调查。
ITIL 事件管理实践强调在整个事件生命周期中保持适当的沟通与文档记录。这既能为所有必要的相关方提供工单更新信息,也能让技术人员在类似事件重现时,快速找到所需的解决经验。
典型的事件诊断包括:
- 初步评估:收集更多背景信息并验证症状
- 环境分析:审查系统日志、配置以及近期变更
- 识别事件背后的原因:通过结构化的故障排查方法,进行根本原因分析
- 解决方案制定:选择临时变通方案或永久修复方案
- 测试与验证:在实施前验证解决方案的有效性
阶段六:解决验证与关闭
合格的事件关闭 需要验证所提供的解决方案是否解决了根本问题、确保用户满意,并恢复了服务正常运行。像 ServiceDesk Plus 这样的现代 ITSM 平台还允许你设置无代码的自动化,在关闭事件工单时强制填写必要的工单数据,从而确保相关数据被记录下来,以满足审计和合规要求。
可通过工单关闭自动化强制收集的一些数据包括:
- 用户确认了服务恢复以及对解决方案的满意度
- 将解决方案更新到了知识库
- 完成了根本原因分析(RCA)
- 工单满意度调查
阶段七:事后审查
事后事件回顾(PIR)将事件转化为组织学习,从而改进未来的事件响应。ITIL 建议在整个事件生命周期中与相关方进行有效沟通,并进行全面的文档记录。PIR 就尤为重要。
如何制定 PIR?
- 时间:在事件关闭后的 48 小时内进行复盘,以便相关细节仍然清晰时完成。
- 参与者:包括所有为解决方案做出贡献的相关者和决策者。
- 原则:保持一种无责备的方式,专注于改进系统而非追究个人责任。
- 文档:生成全面的分析以及具体可行的建议。
PIR 示例:
| 内容 | 要求 | 交付物 |
|---|---|---|
| 执行摘要 | 事件简介和业务影响评估 | 事件概要说明 |
| 时间线 | 按时间顺序排列的事件情况及具体时间戳 | 流程改进分析 |
| 事件分析 | 采用成熟方法进行系统性调查 | 预防措施 |
| 建议 | 具体且可衡量的改进行动 | 实施路线图(roadmap) |
当有多个具有相似特征的事件被标记出来时,会将其视为可能存在一个共同根本原因的问题并进行调查。如果确认是一个问题,就会关联这些事件创建一个问题工单,基于问题,花费更多时间开展根本原因分析(RCA),寻找永久解决方案,标记为已知错误,直到问题闭环。
组织角色和职责
成功的事件管理需要明确定义的角色,以确保在事件生命周期的各个阶段实现协调且高效的响应。每个角色都为服务恢复作出贡献。
事件管理的层级结构
终端用户
终端用户既是事件的初始报告者,也是解决方案的最终验证者。他们在整个事件生命周期中参与的积极性将直接影响问题解决的速度和准确性。
主要职责包括准确记录事件报告并提供全面细节、及时回应技术人员提出的补充信息请求、对问题解决进行确认和反馈,以及遵守既定的沟通渠道。有效的用户参与可以缩短问题诊断所需的时间,并确保解决方案符合实际的业务需求。
一线 服务台/支持
一线支持是服务请求者的第一联络点,也是高效事件管理运营的基础。他们负责事件的初步处理和常见问题的解决,并在整个过程中与用户保持沟通。
核心职能包括根据规则进行初始事件记录、分类和优先级确定,按照流程和知识库处理常见问题,并作为沟通枢纽,促进复杂事件的升级管理。
二线和三线服务台/支持
二三线支持主要针对超出一线解决能力的复杂事件,提供专业的技术支持。这些团队成员具备更深入的技术知识和更广泛的系统访问权限,从而能够进行全面的诊断和解决。
主要职责包括:
- 能够进行深入的技术诊断,解决复杂问题
- 知识库维护和文档编写
- 识别重复出现的问题模式
- 为一线员工提供指导和培训
事件经理
事件经理为整个事件管理流程提供战略性监督,同时担任重大事件响应的主要协调人。事件经理的职责包括监督事件响应、协调重大事件、与相关方沟通,以及在升级过程中进行决策。
阅读我们的电子书,了解 ServiceDesk Plus 让事件经理工作更轻松的 5 种方法。
这是您的免费副本
如果下载没有自动开始,请点击这里。
先进的最佳实践与创新
先进的事件管理实践利用人工智能、自动化和预测分析等先进技术,在既有的 ITIL 基础之上持续拓展。这不仅显著提升了服务质量、用户满意度和工作效率,还有效降低了宕机损耗。
完善落地的自动化功能
自动化是高效服务台运营的基础,使组织能够处理越来越多事件的同时,保持并提升服务质量。
| 自动化水平 | 功能 | 实施重点 | 业务价值 |
|---|---|---|---|
| 基础规则自动化 | 数据校验,自动分配 | 快速部署 | 减少人工工作量 |
| 工作流自动化 | 流程标准化,自动流转 | 一致性与合规性 | 提升服务质量 |
| 高级脚本 | 定制集成,外部系统对接 | 复杂场景编排 | 提高生产力 |
组织应首先通过自动工单分配来制定基于条件的业务规则,然后实施可视化工作流以标准化服务交付流程。最后,他们应开发自定义触发器,以实现与外部系统的连接和复杂场景的编排,从而将平台能力扩展到标准功能之外。
部署生成式 AI,降低流程管理负担
先进的人工智能系统会分析事件特征,并通过将情境相关的知识库文章和解决方案推荐给用户,提供实时协助。内容生成能力包括自动生成高效捕捉关键信息的工单摘要、系统化记录解决方案的知识库文章创作,以及通过情境化的电子邮件回复撰写来增强沟通,从而改善用户交互体验。
部署会话式 AI,为您的第一道事件响应防线
高级聊天机器人可提供 7x24 小时全天候服务,从而实现跨时区和工作时间的服务覆盖。可以处理密码重置、软件安装、系统状态检查等日常任务自动化。配合智能升级功能确保在自动化解决方案不足时,能够无缝转派给人工客服。
充分利用预测性 AI
像 ServiceDesk Plus 这样的先进的 ITSM 平台会部署经过历史数据训练的预测模型(例如 Zia),能够识别事件模式和趋势,从而发现潜在问题。这些模型可以在安排变更时预测变更风险,在分诊工单时分配类别和子类别,指派工单给合适的技术人员,并识别事件模式以预测潜在问题。
可衡量的收益
根据 ManageEngine 进行的最新调研,组织落地 AI 时,主要应用的场景,排名前三的是:流程优化、风险咨询和知识发现。其他场景包括:推荐资源,提升FCR(首相响应即解决率)、通过消除重复性任务来提高技术人员生产力以及工作满意度。
实施数据驱动的决策制定
通过全面的数据分析,推动决策从经验驱动转向数据驱动。实时仪表板可对服务台关键指标进行实时展示,而自定义报表引擎可让管理者针对特定业务需求快速生成定制化分析。
关键绩效指标(KPI)
有效的绩效衡量,需要对关键指标进行系统化跟踪,并提供可落地的洞察分析支持持续改进。关键绩效指标(KPI)的设计,既要体现运营效率,也要兼顾用户满意度与业务影响,保持整体平衡。
关键绩效指标:
| KPI | 定义 | 战略重要性 |
|---|---|---|
| 首次响应即解决率(FCR) | 在工单第一次回复就解决,且无需后续跟进的工单所占的百分比 | 成本降低、用户满意度 |
| 平均解决时间(ART) | 从记录工单到关闭工单的平均耗时 | 服务效率、业务连续性 |
| 平均首次响应时间(AFRT) | 工单创建到技术人员首次给到用户响应所花费的时间 | 用户体验、预期管理 |
| 平均识别时间(MTTD) | 从事件真实发生到事件被识别为一个事件单,所用的时间 | 风险缓释、前瞻性管理 |
| SLA 达标率 | 满足约定的服务级别协议的工单所占百分比 | 服务可靠性与客户信任 |
| 客户满意度(CSAT) | 用户对服务质量的满意程度 | 关系质量和服务价值 |
术语表
- 能动型人工智能(Agentic AI):一类新兴的人工智能技术,能够在无需持续人工监督的情况下自主完成任务。
- 配置管理数据库(CMDB):集中存储 IT 基础设施信息及其关系的数据库。
- 会话式人工智能系统:通过实现自然语言交互,将首次响应交由 AI 处理,从而减少 ITSM 支持工作量的系统。
- IT资产管理(ITAM):对IT资产从初始采购到最终报废的全生命周期进行全面管理,用于成本优化并满足合规要求。
- 关键绩效指标(KPI): 用于对服务台进行衡量的指标,实现数据驱动的决策制定和持续改进。
- 事后事件回顾(PIR):在重大事件解决后举行的结构化的分析会议,目标是将经验教训总结到知识库中。
- 预测分析:利用统计算法和机器学习,根据历史和实时数据模式来对未来可能的结果进行预测。
- 服务级别协议(SLA):服务提供商与客户之间签订的书面合同,用于说明提供的服务、相关的绩效标准(一般为:多少时间内响应,多少时间内解决),以及服务提供商在违反这些标准后,将如何被追究责任。
结论
先进的事件管理将经过验证的 ITIL 方法论与创新技术和数据驱动洞察分析相结合。这推动了服务质量、用户满意度和业务连续性的显著提升,同时降低了宕机成本。无论你的事件管理处于什么样的成熟度,如果你希望提升事件管理的能力,只要将人工智能、预测分析和高级自动化能力与本指南中概述的框架和最佳实践相结合,相信都会给你带来意想不到的价值。
