鉴于部署的指数增长和日益复杂,Kafka 性能监控对于确保 Kafka 集群的最佳性能和可用性至关重要。由于 Kafka 在多个节点的多个分区上运行,动态扩展并处理大量数据,管理和监控这些集群可能具有挑战性。Kafka 监控通过跟踪关键指标、实时识别问题并确保快速修复,有助于提高正常运行时间和集群性能。
Applications Manager 提供了面向生产的 Kafka 监控套件,帮助有效跟踪 Kafka 消息生态系统,帮助组织维护消息传递和数据传输的高可用性和高效性,实现无缝业务运营。我们的 Kafka 监控工具专为满足企业需求设计,帮助您缩短解决生产问题的时间,从而使工程团队在系统部署中更高效地工作。
无论您是经验丰富的 Kafka 管理员还是生态系统新手,像 Applications Manager 这样的 Kafka 监控软件都能为您提供所需的可视性和控制,确保 Kafka 集群平稳运行。Applications Manager 的 Kafka 监控器 允许您在我们的 Kafka 监控仪表板 中跟踪以下指标:
获取 Kafka 服务器资源使用统计的详细洞察,清晰了解 Kafka 服务器的利用能力。借助 Applications Manager 的 Kafka 监控工具,您可以跟踪:

密切关注 Kafka 服务器中用于处理多个消息请求的线程,防止瓶颈,如内存过载、线程死锁和线程饥饿。Applications Manager 的 Kafka 监控通过跟踪守护线程、峰值线程和活动线程数等指标,帮助您分析线程详情,以便在性能异常时识别实际导致问题的线程。

| 用例 | Applications Manager 如何支持 |
|---|---|
| 确保代理和主题健康 | 监控代理统计和主题级指标,如输入/输出字节数、失败请求和分区状态,以维护 Kafka 集群稳定性。 |
| 跟踪 Kafka 资源和 JVM 性能 | 提供 CPU 使用率、内存消耗、线程数和 JVM 堆指标的可视性,防止资源耗尽。 |
| 及早检测控制器和分区问题 | 跟踪控制器状态、离线分区、领导者数量和非正常领导者选举,及早识别集群健康问题。 |
| 监控网络吞吐量和请求行为 | 捕获生产和获取请求速率、网络吞吐量及请求处理模式,发现性能瓶颈。 |
| 对 Kafka 性能异常进行主动警报 | 启用基于阈值的关键 Kafka 指标警报,如失败的生产/获取请求和异常资源使用。 |
从 Kafka 仪表板监控 Kafka 集群的核心指标,深入了解以下组件的性能:
获取 Kafka 集群中 broker 内正在运行的主题的完整信息,并在任何主题表现异常时配置警报。密切关注主题的关键指标,如输入或输出字节数、消息数以及失败的 fetch 或 produce 请求,并比较各主题的性能,以便就资源分配或主题间负载均衡做出明智决策。
Applications Manager 的 Kafka 主题监控跟踪以下 Kafka 主题的关键指标:
| 参数 | 描述 |
|---|---|
| 日志详情 | |
| 日志刷新率 | 异步磁盘日志刷新率。 |
| Broker 主题指标 | |
| 每分钟输入字节数 | 每分钟的总输入字节率(写入该 broker 上主题的数据量)。 |
| 每分钟输出字节数 | 每分钟的总输出字节率。 |
| 每分钟拒绝字节数 | broker 每分钟拒绝的消息数据量。 |
| 每分钟失败的 Fetch 请求数 | broker 每分钟未能处理的消费者数据读取请求数。 |
| 每分钟失败的 Produce 请求数 | 生产者请求失败的次数。 |
| 每分钟输入消息数 | 进入 Kafka broker 的消息数。 |
| 复制管理器 | |
| 每分钟 Isr 扩展次数 | “同步”副本扩展的次数。 |
| 每分钟 Isr 缩减次数 | “同步”副本缩减的次数。 |
| Leader 数量 | 某主机作为 leader 的分区数量。 |
| 分区数量 | 集群中的分区数量。 |
| 副本不足的分区 | 表示集群中副本不足的分区数量。 |
| 请求处理器平均空闲百分比 | 请求处理线程的平均空闲时间比例。 |
获取作为控制器的 Kafka broker 的详细信息,用于管理 Kafka 集群中的分区、leader 和副本。跟踪活动控制器,以识别集群中问题发生时的 leader broker 及离线分区的准确数量,便于快速排查和事件解决。
以下是您需要关注的 Kafka 控制器关键指标:
| 参数 | 描述 |
|---|---|
| Kafka 控制器详情 | |
| 活动控制器数量 | 集群中活动控制器的数量。 |
| 离线分区计数 | 不可用分区的数量。 |
| 领导者选举率 | 领导者选举的速率。 |
| 非正常领导者选举率 | 非正常领导者选举的速率。 |
获取您的 Kafka 服务器消息详细信息的全面概览,并监控代理主题上的请求吞吐量或总进出字节速率,以识别可能的瓶颈并采取适当措施,例如在必要时为消息实现端到端压缩。
以下是需要在您的 Kafka 网络中监控的关键指标列表:
| 参数 | 描述 |
|---|---|
| 请求处理速率 | |
| 请求生产 / 分钟 | 在此代理上写入主题的消息数量。 |
| 请求获取消费者 / 分钟 | 消费者从此代理上的主题获取的数据量。 |
| 请求获取跟随者 / 分钟 | 分区的跟随者代理请求获取新数据。 |
| 请求耗时 | |
| 总生产时间 / 分钟 | 服务指定请求的总时间。 |
| 总获取消费者时间 / 分钟 | 消费者从此代理上的主题获取数据的总时间。 |
| 总获取跟随者时间 / 分钟 | 分区的跟随者获取新数据所花费的总时间。 |
| 网络处理器速率 | |
| 网络处理器平均空闲百分比 / 分钟 | 网络处理器每分钟的平均空闲容量。 |
获取 Kafka 集群中 broker 内正在运行的主题的完整信息,并在任何主题表现异常时配置警报。密切关注主题的关键指标,如输入或输出字节数、消息数以及失败的 fetch 或 produce 请求,并比较各主题的性能,以便就资源分配或主题间负载均衡做出明智决策。
Applications Manager 监控 Kafka 主题的以下关键指标:
| 参数 | 描述 |
|---|---|
| 主题详情 | |
| 主题名称 | 指定主题的名称。 |
| 字节输入 / 分钟 | 每分钟的总输入字节率(写入该 broker 上主题的数据量)。 |
| 每分钟输出字节数 | 每分钟的总输出字节率。 |
| 每分钟失败的 Fetch 请求数 | 每分钟失败的获取请求总数。 |
| 每分钟失败的 Produce 请求数 | 失败的生产者请求总数。 |
| 每分钟输入消息数 | 进入 Kafka 代理的消息数量。 |
通过跟踪集群、代理和主题配置,并处理分区领导者选举,使用 Apache ZooKeeper 管理您的 Kafka 集群。由于 ZooKeeper 存储有关 Kafka 代理、主题和分区的元数据,并处理选举分区领导者等管理任务,请密切关注 ZooKeeper 指标,以防止不必要的性能故障或延迟,维护健康的 Kafka 集群。

通过识别 Kafka 集群中的性能问题(如消费者滞后或离线分区)并通过电子邮件、短信或 Slack 接收即时通知,简化事件检测和解决。您可以将这些告警发送到外部事件管理工具,如 ServiceNow 或 ManageEngine ServiceDesk Plus。您还可以通过自动化纠正操作(例如使用 webhook 启动外部操作)快速响应事件。
利用机器学习的力量进行 Kafka 集群性能的预测性报告,以及 AI 驱动的告警和报告功能,简化 Kafka 性能监控和故障排除,确保业务连续运行。

使用 Applications Manager 解锁无缝的 Kafka 监控体验。跟踪所有关键的 Kafka 性能指标以及您的其他应用程序堆栈。立即获取最新版本!
30天免费试用Kafka监控 是监督Kafka中的资源使用和底层操作的过程,以确保其性能不受影响。Kafka在容量和复杂性方面都有显著增长,作为IT基础设施中的关键组件,有必要实施专门的Kafka监控软件——如ManageEngine Applications Manager——来跟踪其操作,识别并解决瓶颈,优化性能。
监控Kafka有助于确保系统正常运行和最佳效率。实时提供吞吐量、延迟和资源消耗等指标的详细洞察,帮助管理员识别性能异常并及时纠正。代码级可见性有助于更快地排查问题并确保快速修复。这提升了Kafka的可用性并增强了最终用户体验。利用历史分析预测Kafka性能,促进主动Kafka管理,并在规划容量和增长时派上用场,确保Kafka集群的平稳运行。
Applications Manager的Kafka监控工具起价为395美元/年,可监控最多10个Kafka集群。它是您业务中最具成本效益的Kafka监控解决方案之一,并且随着Kafka部署规模的增长,支持您扩展监控。
使用Applications Manager设置Apache Kafka监控非常简单。只需在Kafka代理上启用JMX,并通过指定JMX凭据(包括用户名、密码、JMX端口和JNDI路径)在Applications Manager中设置Kafka监控器。
您可以收集与以下所有Kafka组件的健康和性能相关的详细Kafka监控指标:
请参阅我们的Kakfa监控帮助页面了解更多信息。