问题描述
920BS机型(BMC基线25.12 LTS SP2)DC测试,跑到第235圈时异常暂停,隔十几个小时后发现并强制重启后DC脚本又正常执行,目前通过日志看第235圈下电上电均正常,想求助帮忙分析下暂停原因。
分析结论
OS下脚本记录日志

BMC一键收集日志
J463G3_2102315PFS10RC100003_20260721-1738.tar.gz (13.9 MB)
操作日志
下电状态及上电状态目前看均正常
920BS机型(BMC基线25.12 LTS SP2)DC测试,跑到第235圈时异常暂停,隔十几个小时后发现并强制重启后DC脚本又正常执行,目前通过日志看第235圈下电上电均正常,想求助帮忙分析下暂停原因。
OS下脚本记录日志

BMC一键收集日志
J463G3_2102315PFS10RC100003_20260721-1738.tar.gz (13.9 MB)
操作日志
下电状态及上电状态目前看均正常
答案内容由AI生成,仅供参考:
综合来看,DC 测试在第 235 圈暂停的根因很可能与 BCU 异常 或 ipmiservices 中断 有关,导致 BMC 无法提供完整的硬件信息,测试脚本因此触发暂停保护机制。BMC 基线为 LTS SP2,该版本亦存在已知的组件服务异常风险,两者叠加可能是偶发故障的原因。
通过检查上述日志,尤其是重启前的 framework.log 和 app.log,应该能够定位到具体的组件或服务异常。同时建议关注社区话题 4808 和 6715 的后续更新,其中提供了类似的定位思路和解决方案。
根据您提供的现象(920BS 机型,BMC 基线 25.12 LTS SP2,DC 测试在第 235 圈异常暂停,强制重启后恢复正常)以及社区已有案例,初步分析如下:
在 openUBMC 论坛中,存在与您描述的十分相近的案例 DC 测试暂停期间 BMC Web 页面 BCU 相关关键信息空白(即话题 4808)。该案例中:
ipmitool 收集全空白,暂停 DC 后发现 BMC Web 界面无法显示 CPU、内存、BIOS 版本等信息,且无法通过按钮正常下电、重启。此案例与您的问题高度一致:DC 测试过程中出现异常暂停,BMC 部分功能失效,强制重启后恢复。因此,您的故障很可能也与此类问题同源。
基于上下文知识图谱与文档片段,以下因素值得重点排查:
Relationships: BCU -> DC Test, description: The BCU showed abnormal behavior during the DC Test, possibly contributing to observed issues.)。ipmitool 收集到空白数据(Relationships: DC Test -> ipmitool, description: During the DC Test, ipmitool collected blank data, indicating a diagnostic issue.)。2026-06-17 15:45:27 ERROR: some service failed to start, and BMC will attempt to restart for recovery
虽然您描述中没有明显 BMC 复位日志,但可能出现服务级异常(如 hwproxy、hwdiscovery 组件内部错误),导致资源树未正常构建或更新,从而使测试脚本陷入等待或判定为失败而暂停。| 日志文件 | 关注点 |
|---|---|
/var/log/app.log |
查看第 235 圈对应时间点是否有组件启动失败、KILL self、object_register failed 等异常。 |
/var/log/framework.log |
检查 maca 框架的组件启动/重拉记录,确认是否有组件反复崩溃或 HealthCheck 失败。 |
/var/log/ipmi/ 相关日志 |
确认 ipmiservices 连接状态、BT/KCS 通信是否正常。 |
一键收集日志中的 ipmi_sdr.log |
检查传感器数据是否完整,是否有 DevID 0xffff 等异常值(该值曾在 Cooling Control Log 中出现,可能与系统错误有关)。 |
特别建议在强制重启前,保存完整的 BMC_串口.zip 级联日志,以捕获 BMC 在暂停时间段内的内部状态。
综合来看,DC 测试在第 235 圈暂停的根因很可能与 BCU 异常 或 ipmiservices 中断 有关,导致 BMC 无法提供完整的硬件信息,测试脚本因此触发暂停保护机制。BMC 基线为 LTS SP2,该版本亦存在已知的组件服务异常风险,两者叠加可能是偶发故障的原因。
通过检查上述日志,尤其是重启前的 framework.log 和 app.log,应该能够定位到具体的组件或服务异常。同时建议关注社区话题 4808 和 6715 的后续更新,其中提供了类似的定位思路和解决方案。
如果BMC没异常的话,不太好分析。建议在执行脚本加打印