防火墙型号:SecPath F1000-AI-65
就一个互联网出口也只有一台防火墙,什么问题会导致会话数飙升,场景是办公楼2百多人
内部有一个Zbbix、门禁 指纹 会议门牌 IP电话;周末防火墙刚上架,周一开始每天八点会话数会突然飙升,下午有的时候也会这样,今天看诊断发现GetNextEntityIndex DriFailed!、25号口Down了然后会话数飙升,看了下防火墙用的光模块,是:
Ten-GigabitEthernet1/0/25 transceiver information:
Transceiver Type : 10G_BASE_LR_SFP (SFP+ 封装)
Connector Type : LC
Wavelength : 1310 nm
Transfer Distance : 10 km (SMF)
DDM : YES (但 H3C 无法读取)
Vendor Name : HG GENUINE (华工正源)
<FW-Huayou>display transceiver diagnosis interface Ten-GigabitEthernet 1/0/25
The transceiver does not support this function.
<FW-Huayou>
会话数飙升是什么原因呢?
架构:
Internet
|
25口
FW
24口
|
SW core
|
SW----server
|
AP*18
一、核心结论:外网 25 口 Down 断网,一定会引发防火墙会话数暴涨,结合你的现场场景完整拆解原因
1、外网链路中断造成会话飙升的底层原理
互联网出口 Ten1/0/25 光口 Down 之后,内网所有终端、服务器向外网发起的 TCP 请求(网页、办公软件、IP 电话注册、Zabbix 外网上报、门禁云同步)全部收不到外网 SYN+ACK 回应。
Windows、手机、业务程序自带重试机制,会反复高频发送 SYN 握手报文;防火墙只要收到内网 SYN 包,就会创建一条 TCP 半连接会话表 占用会话资源。
链路断的时间越长,堆积的半连接会话越多,会话曲线直接飙升;一旦会话表占满上限,全网新连接全部新建失败,所有人无法上网。
2、周一早 8 点固定会话飙升的两个叠加因素
1)上班开机重试风暴(主要)
周一早晨 200 人电脑、18 台 AP 接入手机同时开机联网:浏览器、企业微信、钉钉、IP 电话、门禁门牌、Zabbix 服务器同时发起外网连接。
外网刚好因为光模块故障间断闪断(25 口 HG 华工光模块无法读取 DDM 诊断、兼容性差,极易不定时闪断 Down),终端访问外网超时疯狂重试,瞬间产生上万条半连接会话,会话量陡增。
2)光模块隐性故障间歇性断网
你外网使用 HG 正源 10G LR 光模块,防火墙无法读取 DDM 光功率,代表模块兼容性异常、光功率不稳,白天不定时瞬断外网链路,每次断网都会触发一轮内网终端重试,对应你描述「下午偶尔会话也飙升」。
3、日志 GetNextEntityIndex DriFailed! 含义
该报错是防火墙SNMP MIB 实体遍历读取失败:外网光口频繁 Up/Down、接口状态反复变化,防火墙 SNMP 进程遍历接口表项时读取索引异常抛出告警,侧面佐证 25 口光口频繁闪断抖动,正是会话暴涨的诱因。
4、额外业务加剧会话上涨的内网设备
内网几类设备断网后重试行为极强,放大会话压力:
IP 电话:断网后不停向外网注册服务器发起注册请求,高频新建 UDP/TCP 会话;
门禁、会议门牌 IoT 设备:持续上报云端状态,断网死循环重试;
Zabbix 服务器:定时外网探测、外网告警上报,断网后批量重试探测;
无线终端(18 台 AP 接入手机、笔记本)移动端 APP 重试频率远高于 PC。
二、为什么这个光模块是故障元凶
transceiver does not support this function:第三方华工正源光模块和 F1000-AI-65 防火墙兼容性差,防火墙无法读取光功率、温度 DDM 信息,无法提前预判光衰故障;
10G LR 万兆单模模块兼容性不良,极易出现隐性瞬断(接口日志看不出 Down,但报文转发中断数秒),断网就触发内网重试风暴;
外网链路只要闪断 1~3 秒,内网几百台终端同步重试,足以让防火墙会话瞬间翻倍。
三、完整故障因果链
第三方光模块兼容性差 → 外网 25 口不定时闪断 / 物理 Down → 内网所有终端、IoT、服务器外网访问无回应 → 终端 TCP 反复重传 SYN → 防火墙疯狂生成大量半连接会话 → 会话统计数值飙升;同时接口频繁上下线导致 SNMP 读取报错 GetNextEntityIndex DriFailed!。
四、分步整改方案(先解决会话暴涨,再根治光口故障)
步骤 1:防火墙优化会话老化,杜绝断网后会话堆积(立刻配置)
plaintext
# 缩短TCP半连接超时(默认30s改成5s,断网无效会话快速释放)
firewall session aging-time tcp syn 5
# 普通TCP空闲会话缩短老化
firewall session aging-time tcp idle 300
# UDP短会话快速老化
firewall session aging-time udp idle 60
# 限制单个内网IP最大新建会话,防止某一台设备疯狂重试占满会话表
firewall session source-limit per-source maximum 800
步骤 2:替换外网光模块,彻底解决链路闪断(根治根源)
换掉 HG 正源第三方 SFP + 模块,改用 H3C 原厂 SFP-XG-LR-SM1310 万兆单模模块;原厂模块支持 DDM 诊断,防火墙可查看光功率提前预警故障;
更换后查看光功率:display transceiver diagnosis interface Ten-GigabitEthernet 1/0/25,正常收发功率在 -6~-15dbm 区间;
外网接口增加 Down 抑制,防止光纤轻微抖动反复 UP/DOWN:
plaintext
interface Ten-GigabitEthernet 1/0/25
link-delay up 3000 down 3000
步骤 3:定位会话暴涨时的异常 IP(确认是全网重试还是某台设备异常)
plaintext
# 查看会话分布,找出占用会话最多的内网IP
display session table top source count 20
# 查看半连接数量占比
display session statistics protocol tcp
如果大量源 IP 都是办公网段 PC:就是外网断网全体重试;
如果单一 IP 霸占上万会话:排查该终端中毒、程序异常疯狂发包。
步骤 4:内网 IoT 设备优化(门禁、IP 电话、门牌)
在核心交换机上,给门禁、IP 电话所属 VLAN 配置 ACL 限流,限制每秒新建会话数量,断网时避免 IoT 设备疯狂重试放大故障。
五、补充说明
只有外网链路完全稳定不闪断,才能彻底杜绝「断网重试造成会话飙升」;只优化会话老化只能缓解堆积,不能根治;
周一 8 点高峰叠加外网瞬断 = 会话暴涨最明显,下午外网偶尔闪断就会零星暴涨,完全吻合你现场现象;
F1000-AI-65 会话规格充足,200 人办公正常会话一般仅 2~5 万,一旦暴涨至 15 万以上基本都是外网断网引发的大量半连接。
精简总结
外网 25 口光模块兼容性差频繁闪断,内网设备访问外网超时反复重试,大量 TCP 半连接会话生成,直接造成防火墙会话飙升;GetNextEntityIndex DriFailed 是网口频繁抖动带来的 SNMP 报错佐证;
周一早 8 点上班开机流量叠加链路闪断,因此每天早上固定出现会话峰值;
解决顺序:优化会话老化规则 → 更换原厂万兆光模块修复外网链路 → 限流内网 IoT 设备,即可彻底解决问题。
暂无评论
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
暂无评论