HP服务器故障排查报告

HPE DL380 服务器开机后黑屏死机问题

一、基本信息

  • 设备型号: HPE ProLiant DL380(iLO 5)
  • 主机名: HP
  • 操作系统: Ubuntu 20.04(内核 5.4.0-216-generic,桌面版 GNOME/GDM3)
  • 故障现象: 服务器开机后运行一段时间即出现黑屏、无显示输出、系统无响应,需人工强制断电重启

二、故障现象描述

该服务器在开机运行约28-30分钟后,会出现黑屏无显示、系统无响应的情况,只能通过强制断电/重启恢复。该现象在同一天内重复出现三次。排查初期怀疑与磁盘/RAID阵列状态异常(硬盘活动指示灯上出现"请勿移除"红色图标)有关,但经日志分析后确认与硬盘无直接关联。

三、日志分析与时间线

通过服务器系统日志(syslog)比对三次开机记录,发现完全一致的规律:每次开机后约28-29分钟,系统会主动触发"Suspend(挂起)"操作,随后日志中断,期间设备黑屏无响应,只能强制重启后才恢复。具体时间线如下:

时间 事件 说明
10:02 系统开机(第1次) 正常启动完成
10:30:45 触发 Suspend(系统挂起) systemd 记录 "Starting Suspend..." / "Suspending system...",开机后约28分钟触发
10:30 - 11:11 无日志 / 黑屏无响应 约40分钟系统无任何日志输出,期间屏幕黑屏无显示,判断为挂起后无法正常恢复
11:11:23 冷启动(第2次) 内核完整重新加载(非从睡眠恢复),确认为强制重启后的全新开机
11:40:16 再次触发 Suspend 开机后约29分钟再次触发挂起,与第一次时间间隔高度一致
11:40 - 14:08 无日志 / 黑屏无响应 约2.5小时无日志,同样表现为黑屏无响应
14:08:14 冷启动(第3次) 再次强制重启后开机
14:2x - 至今 问题排查与修复 登录系统确认为 Ubuntu 桌面版 GNOME 自动挂起策略触发,非硬盘/RAID故障

四、根本原因

经确认,该服务器安装的是 Ubuntu 桌面版系统(GNOME 桌面环境),系统默认开启了"闲置一段时间后自动挂起(Automatic Suspend)"电源管理策略,触发周期约为28-30分钟。

问题核心在于:HPE DL380 属于服务器硬件,其主板 BIOS/ACPI 通常并未针对 S3 睡眠状态(Suspend to RAM)进行充分验证或支持。当系统尝试进入挂起状态后,无法正常恢复,导致黑屏卡死、无任何显示输出,只能通过强制断电重启恢复。

因此,本次故障的根本原因判定为:GNOME 桌面自动挂起策略触发了服务器不支持的 S3 睡眠状态,而非磁盘、RAID阵列或内存等硬件故障。

五、已采取的修复措施

按照"系统层 + 应用层"双重屏蔽的方式,彻底禁用该服务器的挂起/睡眠功能:

操作 命令
屏蔽 systemd 睡眠相关 target systemctl mask sleep.target suspend.target hibernate.target hybrid-sleep.target
验证屏蔽状态 systemctl status sleep.target → 返回 masked
关闭 GNOME 接电源时自动挂起 gsettings set org.gnome.settings-daemon.plugins.power sleep-inactive-ac-type 'nothing'
关闭 GNOME 电池供电时自动挂起 gsettings set org.gnome.settings-daemon.plugins.power sleep-inactive-battery-type 'nothing'
验证配置生效 gsettings get org.gnome.settings-daemon.plugins.power sleep-inactive-ac-type → 返回 'nothing'

六、验证结果

  • systemctl status sleep.target 返回 "Loaded: masked",确认 systemd 层面挂起功能已被屏蔽
  • gsettings get 返回 'nothing',确认 GNOME 自动挂起策略已关闭
  • 后续需持续观察,重点关注开机后30分钟左右的时间节点是否仍出现黑屏

七、关于硬盘指示灯的说明(附带排查)

排查过程中发现该服务器3块硬盘中有1块的"请勿移除"指示灯常亮,经确认该阵列为 RAID 0(无冗余)。RAID 0 下该指示灯常亮通常代表控制器对该盘进行持续的重试读写(该盘可能存在预测性故障或响应异常),而非正常的阵列重建行为。

由于本次黑屏问题已确认由系统挂起策略导致,与该硬盘现象暂无直接因果关系,但该盘状态仍存在潜在风险,建议后续独立跟进处理,具体建议如下:

  • 登录 iLO / SSA 或执行 ssacli ctrl all show config detail 命令,确认该逻辑盘及物理盘的具体状态(是否为 Predictive Failure / Failed)
  • RAID 0 无容错能力,若该盘确认存在故障风险,建议尽快备份阵列上的数据
  • 如条件允许,建议评估是否将该阵列迁移至有冗余能力的 RAID 级别(如 RAID 1/5/6),降低单盘故障导致数据丢失的风险

八、结论与建议

  • 本次黑屏死机故障的根本原因为系统电源管理策略(GNOME 自动挂起)与服务器硬件不兼容,已通过 systemctl maskgsettings 配置修复
  • 建议后续在该服务器上新装系统时,优先安装 Ubuntu Server(无桌面环境)版本,从源头避免此类桌面电源管理策略带来的问题
  • 建议持续观察至少1-2个工作日,确认问题不再复现后可视为闭环
  • 该阵列的1块硬盘状态异常问题建议单独跟进,避免因 RAID 0 单盘故障导致数据丢失
Copyright © https://yan-jian.com 2023 - 2026 All Right Reserved all right reserved,powered by Gitbook更新时间: 2026-08-17 16:25:03

results matching ""

    No results matching ""