最后更新日期:2025年9月10日

本节将重点介绍事件管理与问题管理之间的区别,以及问题管理如何与其他支持的 ITSM 实践协同工作。

事件管理与Problem管理的比较

Incident management 和 problem management

事件和问题这两个术语看似同义,但在实现理想服务质量的过程中,它们各自扮演着不同的角色。了解 incident managementproblem management 之间的交互以及它们的区别尤为重要,特别是在事件结束和问题开始的界限处。

事件管理

事件是对整个服务或其某个组件的非计划中断。让我们通过一个场景来更好地理解它。距离重要会议还有 15 分钟,需要打印一份报告。不幸的是,部门打印机无法使用。快速提交了工单以临时解决问题并打印报告。这就是一个事件。

incident management process 旨在处理事件并尽快恢复服务。在我们的场景中,服务台人员迅速将笔记本电脑连接到邻近部门的打印机,帮助用户及时准备好报告。因此,事件管理的目标是确保通过临时解决方案或最终解决方案尽快解决中断或事件。

问题管理

问题管理不涉及恢复服务或故障排除,而是确定并消除根本原因。当存在多个具有共同问题的重复事件,或发生影响众多用户的 major incident 时,服务台会记录一个问题。在我们的场景中,部门唯一的打印机出现故障,影响了该部门所有用户,服务台人员将其记录为问题,以查找原因和解决方案。事件在提供临时解决方案后可以关闭,但问题则是为了永久修复打印机,防止问题再次发生。

回到我们的场景,打印机问题将进行根本原因分析(RCA)以找到永久解决方案,并作为问题工单进行跟踪,同时业务继续使用临时解决方案。如果问题管理团队无法找到解决方案,则记录该临时解决方案并将问题添加到 KEDB。这样,问题管理不仅通过查找根本原因消除事件,还确定可实施的最可行解决方案以最大限度减少中断。有时,即使知道根本原因,最可行的解决方案仍是实施临时解决方案并将其记录为已知错误。

尽管不同,事件管理和问题管理相辅相成且紧密关联。事件管理确保业务运营的连续性,而问题管理则处理潜在的问题和根本原因。

ITSM 流程与问题管理之间的关系

一套集成的服务交付最佳实践体系提升了业务服务和 IT 服务能力。一个 effective problem management process 与多个其他 ITSM 流程存在交互。

Problem vs Incident vs Change vs Asset management

与问题管理交互的流程简要说明如下:

事件管理

Incident management 是在组织中记录、分类、优先级排序、分配和解决问题的系统化流程。事件管理的目标是尽快恢复中断的服务;通常这意味着安排临时解决方案以替代永久解决方案。该实践中的每项活动都被详细记录并推送给问题管理团队,后者启动 RCA 以制定永久解决方案。由此可见,尽管问题管理是独立的流程,但它依赖于强大的事件管理流程。

变更管理

change management 的目标是提高组织内 changes implemented in the organization 的成功率。变更指对组织的 IT 基础设施、流程、服务、产品、应用、供应商或任何其他显式或隐式影响组织服务交付的内容所做的任何修改。

根据 ITSM 框架,问题管理的职责在于找到导致问题的根本原因并提出解决方案,而实际实施解决方案则通过变更控制完成。由于实施变更涉及多个业务单元的风险管理,因此需要独立的流程进行高效处理。然而,问题管理团队应参与变更的实施后评审,以确保问题解决方案与所实施变更的一致性。

IT资产管理

IT asset management 是管理组织资产生命周期的实践。其活动包括最大化资产价值、控制资产成本以及管理资产风险。这些风险可能涉及合规性、供应商选择、使用政策和处置实践。

当问题源自组织使用的硬件和软件资产时,资产管理和问题管理的实践可能会交叉。当问题的根本原因似乎来自某个产品或服务时,IT 资产管理对库存的详细记录加快了问题解决过程。除此之外,IT 资产管理还协助问题管理研究事件影响、检查解决方案实施效果,并在根本原因分析过程中提供必要信息。

IT 问题解决

让我们通过一个场景来具体说明。

Zylker 是印度一家快速发展的库存摄影供应商。孟买的一位经理在从新德里 SQL 服务器生成月度报告时遇到问题。已提交事件,服务台人员通知了新德里的技术人员。作为临时解决方案,报告在本地生成并发送,以确保业务连续性。

Zylker 的主动问题管理团队决定对过去六个月发生的事件进行趋势分析。他们发现涉及新德里服务器的多个事件。由此启动了问题工单,并利用所有记录事件的累积数据进行调查分析。

新德里的技术人员发现 SQL 服务器使用多种协议,包括 iSCSI 和 Fibre Channel,用于连接数据存储设施。由于这两种协议均在以太网网络上运行,技术人员怀疑本地块交换机是否配置为支持大数据包传输。技术人员从 IT 资产管理团队获取数据,确认交换机不是问题根源。这一点得到了本地生成报告没有问题的证据支持。

接下来分析广域网(WAN),因为孟买经理在生成月度报告时遇到问题。技术人员凭借网络问题经验,对每月底的流量状况产生怀疑,于是在公司的路由器和交换机上安装软件,分析通过设备的流量并进行统计汇总。

软件生成的图表显示了使用最多的协议及其一个月内消耗的带宽。这揭示了月末报告生成时段的带宽使用高峰。经仔细检查,发现全量镜像备份安排在报告生成的同一时间段,导致 WAN 出现严重瓶颈。

既然已确定问题根本原因,技术人员提交变更工单,将镜像备份重新安排在业务开始前的凌晨时段,以平衡网络流量。

以下是该场景中执行步骤的概述:

活动 涉及的实践
孟买经理在从新德里 SQL 服务器生成月度报告时遇到问题。提交了事件,报告在本地生成并发送给经理。工单关闭。 事件管理
主动问题管理团队对过去六个月的事件进行了趋势分析,发现涉及新德里服务器的多个事件。 问题管理,事件管理
新德里技术人员观察 SQL 服务器的网络和协议,不确定本地块交换机是否配置为支持大数据包传输。 问题管理,IT 资产管理
技术人员从 IT 资产管理团队获取数据,确认交换机不是问题根源。 问题管理,IT 资产管理
技术人员怀疑每月底的流量状况,在路由器和交换机上安装了分析流量并统计汇总信息的软件。 问题管理,IT 资产管理
经仔细检查,发现全量镜像备份安排在报告生成的同一时间段,导致 WAN 出现严重瓶颈。 问题管理
技术人员提交变更工单,将镜像备份重新安排在业务开始前的凌晨时段。 问题管理,变更管理

所有 ITSM 实践与其他 IT 实践之间都有复杂的关系。随着您的问题管理在服务交付中的成熟,务必改进其与其他实践的互动方式,以实现健康且以业务为导向的服务交付。

接下来:

在明确区分 incident management 和 problem management 以及明确 problem management 对其支持的 ITSM 实践的重要性之后,是时候进入 实践问题管理的不同方法。

评估您的事件响应准备情况,启动您的问题管理之旅。

迈向主动问题管理的第零步是在您的 IT 环境中建立健全的 incident management 流程。了解我们的母公司 Zoho 如何年复一年地处理各种 incident,并评估您在企业规模上的 incident management 准备情况。

下载我们的事件管理手册和最佳实践清单的免费副本,以审查您的问题管理解决方案。

  • 问题管理软件功能清单

    问题管理功能清单

  • 重大 IT incident 处理流程

    IT 事件管理手册

点击‘获取ITSM资源包’即表示您同意根据隐私政策处理个人数据。

常见问题解答:

1. problem management 和 incident management 有何不同?

2. incident、problem 和 change management 如何相互关联?

这三个 ITSM 流程形成了一个持续改进的循环。incident management 处理单个中断(如网站宕机)。problem management 调查根本原因(网站中的错误代码)。problem management 的这些知识可以触发变更请求,可能涉及修补错误代码(实施修复)。change management 确保该修复顺利实施,最大限度地减少进一步中断的风险。它们有效协作,确保 IT 服务可靠且不断改进。

3. change management 和 problem management 有何区别?

problem management 和 change management 是 ITSM 的两个重要方面。problem management 像侦探一样调查反复发生的 incident 的根本原因。例如,如果网络性能持续缓慢,problem management 会识别出故障的网络设备。然后 change management 根据 problem management 的发现实施解决方案,可能包括申请批准更换故障设备、安排维护窗口内的变更,并确保平稳过渡到新设备。通过协作,change management 和 problem management 确保已识别的问题得到有效解决,并最大限度地降低未来中断的风险。

让我们一起支持更快、更简单的方式