一、故障现象复盘
设备:S6520X-30QC-EI,双风扇冗余架构;
现象:单个风扇故障,机房断电冷启动时卡在 BootROM 阶段,反复提示 A fan tray failed. Please replace the fan tray. System is restarting... 无限重启;更换完好风扇后正常上电启动。
疑问:明明是风扇冗余设计,坏 1 个风扇理应正常运行,为何冷启动直接无法开机?
二、核心根本原因(H3C S6520X 整机风扇启动策略机制)
1. 两个阶段风扇管控规则完全不同(开机自检阶段 / 正常运行阶段,规则不一样,这是关键)
阶段 1:BootROM 开机硬件自检阶段(断电冷启动流程)
S6520X 属于企业级三层汇聚交换机,上电初始化阶段执行严格硬件完整性校验:
上电瞬间 CPU、CPLD 会逐一巡检所有在位硬件:风扇框 1、风扇框 2、电源、主控、内存等全部部件;
出厂安全策略:自检阶段必须所有在位风扇框状态正常,才允许进入系统加载流程;
只要任意一个风扇在位但故障(停转、通信异常、EEPROM 读取失败),BootROM 判定硬件存在故障风险,为防止上电后硬件过热烧毁,直接拒绝引导系统、反复重启告警。
哪怕另一个风扇完好可以散热,自检逻辑并不会区分「冗余可用」,只会判定「存在故障硬件」,触发开机拦截保护。
阶段 2:正常进入 Comware 系统运行阶段(业务运行时)
成功进系统之后,风扇冗余机制才正式生效:
运行中任意 1 个风扇故障,另一个正常风扇全速运转散热;
设备仅产生风扇故障告警,不会重启、不会断业务,这才是风扇冗余真正的价值;
系统运行期间允许单风扇带病运行,保障业务不中断。
总结矛盾点
冗余 = 运行阶段容忍单风扇损坏,保障业务不掉线;
开机自检 = 冷启动不允许带故障硬件开机,规避刚上电就存在散热缺陷引发过热烧机;
两者策略目的不一样,所以出现了你遇到的现象:坏风扇留在槽位、断电重启就卡在 Boot 循环,拆掉坏风扇 / 换上好风扇即可正常启动。
2. 补充两个极易加重该问题的细节
故障风扇并未拔出,依旧在位
如果直接把坏掉的风扇从槽位拔出,只保留 1 个完好风扇上电自检:BootROM 识别风扇在位数量 = 实际正常数量,自检可以顺利通过,交换机正常开机。
你现场是「坏风扇还插在插槽里」,CPLD 检测到槽位存在风扇硬件,但风扇状态异常,判定故障拦截启动。
S6520X 整机开机散热阈值严格
交换机冷启动初期,主板、芯片温度极低,但厂商固件逻辑优先校验硬件完整性,而非实时测温,不会因为当前温度低就跳过风扇故障校验。
三、风扇冗余真正的设计意义(解答你的疑问)
风扇冗余并不是用来「坏掉一个还能断电重启开机」,它的作用是业务运行过程中某个风扇突然损坏时,业务不中断:
交换机已经正常上电、业务跑起来的过程中,某个风扇突然故障停转:
另一路冗余风扇立刻提速承接全部散热任务,设备只上告警、绝不重启,网络业务持续运行;运维人员可择窗口期更换故障风扇,无需断网。
冗余解决的是运行中途风扇损坏的高可用场景,并不包含「带着故障硬件断电重启开机」的场景;
厂商设置开机强校验,是防止机房无人值守场景下:设备断电重启 + 风扇本来就是坏的,上电后无有效散热,短时间高温烧毁主控、交换芯片,造成整机报废。
四、对应本次故障的 2 种临时解决办法
方案 1(临时开机)
将故障风扇直接拔出机箱,仅保留完好风扇,重新上电,自检正常即可开机进系统,后续业务阶段单风扇正常运行。
方案 2(根治)
更换故障风扇框,双风扇全部正常后,无论冷启动还是运行阶段,均可完整冗余。
五、延伸:堆叠环境额外注意事项
堆叠两台交换机,只要其中一台存在风扇故障未拔除,这一台断电重启依旧会自检拦截、反复重启,造成堆叠分裂;
堆叠场景运维规范:发现风扇故障后,要么及时更换,要么临时拆掉坏风扇,不要长期将故障风扇留在插槽内,避免断电后设备无法拉起、堆叠故障。
六、精简总结
开机 Boot 自检:校验全部在位硬件,只要插槽内存在故障风扇就阻止启动,属于硬件保护机制;
进入系统运行后:风扇冗余机制生效,坏 1 个风扇不会重启,保障业务连续,这才是冗余的作用;
你现场故障本质:坏风扇未拔出 → 上电自检检测到在位风扇异常 → Boot 拒绝引导系统无限重启。
若拔掉损坏风扇只留正常风扇上电,交换机即可正常启动并单风扇运行。
你遇到的问题,根源在于一个关键但容易误解的设计逻辑:交换机在启动时执行的是最严格的硬件自检,这个阶段的“冗余”概念与正常运行时的“冗余”是不同的。
简单来说,S6520交换机在启动时要求所有核心硬件(包括风扇)必须处于完全正常的状态,否则将被视为不满足安全启动条件而中断启动过程。
这是导致问题发生的核心阶段。交换机上电后,BootROM会执行一次全面的硬件自检(POST),以确保所有关键组件在操作系统加载前都工作正常。
启动策略是“零容忍”:在这个阶段,只要检测到任何一个关键部件(如风扇)存在故障,系统出于最大程度的保护,就会判定硬件平台不满足安全运行的要求,从而拒绝继续启动。这是一种保护机制,旨在避免设备在散热能力不完整的情况下运行,导致更严重的硬件损坏。
与运行时的差异:当交换机成功启动并进入系统后,风扇监控策略会切换到“运行态”。这时,系统允许一定程度的冗余,例如允许单个风扇故障,并通过告警通知管理员更换。而你遇到的情况是启动自检,它会严格执行“全部正常” 的标准。
你可能会疑惑,既然一个风扇故障就能导致无法启动,那“冗余”设计的意义何在?它的价值主要体现在运行时的可靠性和维护的便利性上。
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
有这功夫纠结400找告诉你答案了,要么商务成面摆平吧。