HP服务器故障排查报告
HPE DL380 服务器开机后黑屏死机问题
一、基本信息
- 设备型号: HPE ProLiant DL380(iLO 5)
- 主机名: HP
- 操作系统: Ubuntu 20.04(内核 5.4.0-216-generic,桌面版 GNOME/GDM3)
- 故障现象: 服务器开机后运行一段时间即出现黑屏、无显示输出、系统无响应,需人工强制断电重启
二、故障现象描述
该服务器在开机运行约28-30分钟后,会出现黑屏无显示、系统无响应的情况,只能通过强制断电/重启恢复。该现象在同一天内重复出现三次。排查初期怀疑与磁盘/RAID阵列状态异常(硬盘活动指示灯上出现"请勿移除"红色图标)有关,但经日志分析后确认与硬盘无直接关联。
三、日志分析与时间线
通过服务器系统日志(syslog)比对三次开机记录,发现完全一致的规律:每次开机后约28-29分钟,系统会主动触发"Suspend(挂起)"操作,随后日志中断,期间设备黑屏无响应,只能强制重启后才恢复。具体时间线如下:
| 时间 | 事件 | 说明 |
|---|---|---|
| 10:02 | 系统开机(第1次) | 正常启动完成 |
| 10:30:45 | 触发 Suspend(系统挂起) | systemd 记录 "Starting Suspend..." / "Suspending system...",开机后约28分钟触发 |
| 10:30 - 11:11 | 无日志 / 黑屏无响应 | 约40分钟系统无任何日志输出,期间屏幕黑屏无显示,判断为挂起后无法正常恢复 |
| 11:11:23 | 冷启动(第2次) | 内核完整重新加载(非从睡眠恢复),确认为强制重启后的全新开机 |
| 11:40:16 | 再次触发 Suspend | 开机后约29分钟再次触发挂起,与第一次时间间隔高度一致 |
| 11:40 - 14:08 | 无日志 / 黑屏无响应 | 约2.5小时无日志,同样表现为黑屏无响应 |
| 14:08:14 | 冷启动(第3次) | 再次强制重启后开机 |
| 14:2x - 至今 | 问题排查与修复 | 登录系统确认为 Ubuntu 桌面版 GNOME 自动挂起策略触发,非硬盘/RAID故障 |
四、根本原因
经确认,该服务器安装的是 Ubuntu 桌面版系统(GNOME 桌面环境),系统默认开启了"闲置一段时间后自动挂起(Automatic Suspend)"电源管理策略,触发周期约为28-30分钟。
问题核心在于:HPE DL380 属于服务器硬件,其主板 BIOS/ACPI 通常并未针对 S3 睡眠状态(Suspend to RAM)进行充分验证或支持。当系统尝试进入挂起状态后,无法正常恢复,导致黑屏卡死、无任何显示输出,只能通过强制断电重启恢复。
因此,本次故障的根本原因判定为:GNOME 桌面自动挂起策略触发了服务器不支持的 S3 睡眠状态,而非磁盘、RAID阵列或内存等硬件故障。
五、已采取的修复措施
按照"系统层 + 应用层"双重屏蔽的方式,彻底禁用该服务器的挂起/睡眠功能:
| 操作 | 命令 |
|---|---|
| 屏蔽 systemd 睡眠相关 target | systemctl mask sleep.target suspend.target hibernate.target hybrid-sleep.target |
| 验证屏蔽状态 | systemctl status sleep.target → 返回 masked |
| 关闭 GNOME 接电源时自动挂起 | gsettings set org.gnome.settings-daemon.plugins.power sleep-inactive-ac-type 'nothing' |
| 关闭 GNOME 电池供电时自动挂起 | gsettings set org.gnome.settings-daemon.plugins.power sleep-inactive-battery-type 'nothing' |
| 验证配置生效 | gsettings get org.gnome.settings-daemon.plugins.power sleep-inactive-ac-type → 返回 'nothing' |
六、验证结果
systemctl status sleep.target返回 "Loaded: masked",确认 systemd 层面挂起功能已被屏蔽gsettings get返回 'nothing',确认 GNOME 自动挂起策略已关闭- 后续需持续观察,重点关注开机后30分钟左右的时间节点是否仍出现黑屏
七、关于硬盘指示灯的说明(附带排查)
排查过程中发现该服务器3块硬盘中有1块的"请勿移除"指示灯常亮,经确认该阵列为 RAID 0(无冗余)。RAID 0 下该指示灯常亮通常代表控制器对该盘进行持续的重试读写(该盘可能存在预测性故障或响应异常),而非正常的阵列重建行为。
由于本次黑屏问题已确认由系统挂起策略导致,与该硬盘现象暂无直接因果关系,但该盘状态仍存在潜在风险,建议后续独立跟进处理,具体建议如下:
- 登录 iLO / SSA 或执行
ssacli ctrl all show config detail命令,确认该逻辑盘及物理盘的具体状态(是否为 Predictive Failure / Failed) - RAID 0 无容错能力,若该盘确认存在故障风险,建议尽快备份阵列上的数据
- 如条件允许,建议评估是否将该阵列迁移至有冗余能力的 RAID 级别(如 RAID 1/5/6),降低单盘故障导致数据丢失的风险
八、结论与建议
- 本次黑屏死机故障的根本原因为系统电源管理策略(GNOME 自动挂起)与服务器硬件不兼容,已通过
systemctl mask及gsettings配置修复 - 建议后续在该服务器上新装系统时,优先安装 Ubuntu Server(无桌面环境)版本,从源头避免此类桌面电源管理策略带来的问题
- 建议持续观察至少1-2个工作日,确认问题不再复现后可视为闭环
- 该阵列的1块硬盘状态异常问题建议单独跟进,避免因 RAID 0 单盘故障导致数据丢失