建议按以下步骤操作:
确认 Monitor Link 的逻辑:
登录交换机,执行 display monitor-link group { group-id | all } 命令,查看输出中的 Up-link threshold 字段。
如果该值为空或显示为 N/A,说明使用的是默认逻辑(所有上行接口都必须 UP)。
如果该值是一个数字(例如 1),则说明使用的是阈值逻辑。
定位 BGP Connect 状态的原因:
这是解决问题的根本。请重点关注状态为 Connect 的 BGP 会话。
使用 ping 命令测试到对端 BGP 邻居 IP 的连通性。
使用 display ip routing-table 检查是否有到达对端的路由。
检查 BGP 配置,确认邻居的 AS 号、IP 地址等无误。
检查中间链路,确认光纤、光模块等物理层是否正常。
根据情况采取行动:
若采用默认逻辑:必须修复所有 Connect 状态的 BGP 会话,使其全部变为 Established。
若采用阈值逻辑:检查阈值配置,确保其符合你的冗余设计预期。
检查全局状态:
确认 Monitor Link 功能已全局开启:display monitor-link disable。如果显示为 Monitor link is disabled,则需要执行 undo monitor-link disable 来开启
暂无评论
一、先梳理你的组网逻辑
Monitor-link group 1 架构
Uplink(上行主链路):TwoHundredGigE1/0/1,绑定 BGP Peer 集群;
Downlink(下行服务器端口):二十多条业务端口,全部加入 monitor-link group 1 作为下行受控端口;
规则:上行 UP 端口阈值 Up port threshold: 15。
现状:
BGP 一共 7 个邻居,6 个 UP、1 个 DOWN;但 Monitor-link 组状态直接变为 DOWN,所有下行服务器端口被 Monitor-Link 强制 shutdown。
二、核心原因(阈值配置错误是根本)
1. 阈值含义:Up port threshold: 15
这条命令含义:上行链路中,处于 UP 状态的链路数量 ≥15 条,Monitor-Link 组才判定为正常 UP,放行下行端口;上行活跃 UP 链路不足 15 条,Monitor-link 直接置 DOWN,批量关闭所有下行 downlink 端口。
你当前上行只有 1 条 200G 上行物理链路,就算这条链路 BGP 邻居全活,上行物理端口数量永远只有 1 个,远达不到阈值 15。
Monitor-Link 判定「上行链路数量不达标」,触发保护动作:强行 down 掉全部下行服务器接口。
2. 误区说明
你误以为「只要任意一条 BGP 邻居 UP,上行就算正常」,但 Monitor-Link 只识别物理端口状态,不感知 BGP 协议会话状态:
Monitor-link 的 uplink 判断依据:物理端口 TwoHundredGigE1/0/1 的物理 UP/DOWN;
BGP 邻居断开,不会改变上行物理口的物理状态,自然不会触发 monitor-link 联动;
你配置阈值 15,当前上行物理端口仅 1 个,永远无法满足≥15 的条件,monitor-link 永久 DOWN、下行全断。
3. 补充:为什么其中一条 BGP 邻居 DOWN 不影响 monitor-link
BGP 只是运行在 200G 上行接口之上的三层协议,单个 Peer 断开,接口物理层依旧 UP。Monitor-link 不会感知 BGP 邻居状态,只会检测物理端口数量,和 BGP 会话是否 UP 无关。
三、修复方案(二选一,推荐方案 1)
方案 1:修正上行 UP 阈值(适配单条上行链路)
bash
system-view
monitor-link group 1
# 上行仅有1条物理链路,阈值改为1:只要上行端口UP,下行就正常放行
up-port threshold 1
修改完成后,上行 200G 端口物理 UP 时,monitor-link 恢复 UP,所有下行服务器端口自动开启。
方案 2:如果你本意是「依靠 BGP 会话存活来联动下行」
原生 Monitor-link 不支持监听 BGP 邻居,需要改用 NQA+Track+Monitor-link 联动:
配置 NQA 探测其中一条 BGP 对端 IP;
track 绑定 NQA 探测实例;
monitor-link uplink 绑定 track 条目,不再依靠物理端口数量判断上行健康度。
示例极简配置:
bash
nqa entry admin test
type icmp-echo
destination ip 169.254.2.64
frequency 1000
reaction 1 checked-element probe-fail threshold-type consecutive 3 action-type trigger-only
nqa schedule admin test start-time now lifetime forever
track nqa entry admin test
monitor-link group 1
uplink track 1
undo up-port threshold
四、额外排查点
当前上行 200G 口 TwoHundredGigE1/0/1 状态标注 Monitor-Link uplink down,正是因为阈值不满足被 monitor-link 逻辑置 down,并非物理故障;
查看当前上行计数验证:
bash
display monitor-link group 1
会看到 Current up uplink port count:1,小于阈值 15 → 组状态 DOWN。
五、总结
故障本质:up-port threshold 15 配置过大,单条上行链路永远达不到 15 条活跃上行的标准,monitor-link 持续关闭所有下行端口;
Monitor-Link 只检测物理端口数量,无法感知 BGP 邻居是否建立,单条 BGP peer 断开不会触发联动;
快速修复:把 monitor-link 组的上行阈值修改为 up-port threshold 1;如需监控 BGP 存活再改用 NQA+Track 方案。
暂无评论
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
暂无评论