只要数据池状态为异常 / 非健康,平台会锁定存储写入接口,无法新建块设备、无法创建虚拟机磁盘,这是 UIS ONEStor 的集群自我保护机制;
故障根源来自本次批量扩容硬盘的操作异常,并非扩容行为本身不支持。
一、扩容后存储池异常的 6 类高发原因(适配 UIS V7.0 E0742P03)
1. 新增硬盘残留旧分区 / CEPH 元数据(最常见)
扩容硬盘之前做过 NAS、分布式存储、RAID 使用,磁盘头部残留分区表、OSD 标识、文件系统签名。
将磁盘加入硬盘池时,ONEStor 识别冲突,磁盘标记为异常 / 不可用,存储池整体健康状态降级。
2. RAID 阵列卡模式错误
新增硬盘在 RAID 卡内做成了 RAID0/RAID5,没有设置为 JBOD 直通模式。
UIS 无法单独管控单块硬盘、采集 SMART 健康状态,新增磁盘上线失败,存储池异常。
3. 批量加盘触发并发均衡故障
所有节点同步批量新增硬盘,集群瞬间触发大规模数据均衡,后端存储网带宽打满、OSD 进程阻塞,部分 OSD 离线,存储池进入异常状态。
4. 个别新增硬盘物理故障、接触不良
某一块扩容硬盘存在坏道、硬件故障,加入存储池后 OSD 崩溃下线;受副本冗余规则限制,存储池整体变为异常只读状态,禁止新增块设备。
5. 节点维护模式未关闭、仲裁异常
扩容时部分节点开启了维护模式,加盘完成后忘记退出维护;ONEStor 仲裁机制异常,存储池持续异常。
6. 磁盘加入存储池任务中途中断
添加磁盘任务刷新页面、浏览器关闭、节点重启导致任务半残,磁盘元数据前后台不一致,前台显示磁盘异常。
二、为什么异常之后无法新增块设备?
UIS 分布式存储安全机制:
存储池 = 健康 / 警告:允许新建块设备、创建磁盘、写入数据;
存储池 = 异常 / 降级 / 只读:平台上锁,禁止创建新块设备、禁止写入新数据,只允许读取与修复集群,防止继续写入造成副本丢失、数据损坏;
只有把存储池修复至「健康」状态,才能正常创建块存储。
三、分步修复方案(业务优先,不破坏原有业务数据)
阶段 1:排查定位异常对象
登录 UIS 管理页 →【存储】→【存储池】,点开异常数据池详情,查看哪些磁盘状态异常、哪些 OSD 离线;
SSH 登录任意集群节点,执行命令查看完整存储状态:
bash
# 查看存储池整体状态
uiscli storage-pool show
# 查看所有磁盘健康状态
uisadm disk list -a
# 查看离线OSD编号
ceph osd tree
ceph health detail
核对:是否存在硬盘「故障、脱机、未知」、OSD down。
阶段 2:修复异常磁盘(分两种场景)
场景 A:磁盘硬件完好,仅元数据错乱(绝大多数场景)
前台将异常磁盘从存储池中安全移除,系统自动迁移该磁盘上的数据至其余正常硬盘;
SSH 登录对应节点,彻底清空磁盘残留签名(替换 /dev/sdX 为故障磁盘盘符):
bash
wipefs -a /dev/sdX
# 顽固残留补充执行
dd if=/dev/zero of=/dev/sdX bs=1M count=200
UIS 前台【磁盘管理】→右上角同步磁盘 / 校正磁盘信息;
磁盘变为「未使用、空闲」后,重新添加回原存储池,等待数据均衡。
场景 B:磁盘物理损坏
HDM 查看硬盘告警,确认硬盘硬件故障;
存储池冗余副本数≥2、故障盘数量未超限:移除故障硬盘,更换全新硬盘重做扩容流程;
若冗余不足,先临时迁移业务虚拟机,再更换硬盘重建。
阶段 3:收尾校验,恢复存储池健康
确认所有磁盘在线、OSD 全部 up,执行:
bash
ceph health
返回 HEALTH_OK 代表集群正常;
2. 等待集群数据均衡 100% 完成(不要中途新建块设备,均衡阶段性能较低);
3. 存储池变为健康状态后,即可正常创建块设备。
四、本次批量扩容踩坑规避(避免再次异常)
严禁多节点同时批量加盘:逐个节点、每次添加 1~2 块硬盘,等均衡完毕再扩容下一批;
扩容硬盘前置要求:阵列卡改成 JBOD 直通,全盘清空所有分区与残留数据;
扩容全程不要开启节点维护模式;
新增硬盘型号、容量尽量保持一致,避免异构硬盘导致均衡卡顿。
五、补充特殊情况
若存储池仅为警告状态(单块硬盘告警,副本完整):大部分场景仍可以新建块设备;
若是只读异常:必须修复离线 OSD / 故障磁盘,集群恢复健康后才能解除写入锁定;
E0742P03 老版本存在批量加盘的均衡 BUG,如果反复扩容异常,可升级补丁包 E0742P08 修复存储调度缺陷。
精简总结
数据池异常→系统锁定写入,必然无法新增块设备;
本次问题基本是新增硬盘带旧数据、批量并发加盘导致 OSD 离线、存储池降级;
移除异常磁盘→清空磁盘元数据→重新入池→等待均衡完成,集群健康后即可恢复块设备创建。
暂无评论
扩容硬盘后数据池异常,导致无法新建块设备,这通常是数据池在进行数据均衡时,健康度(Health Status)降级所触发的保护机制。
简单来说,不是扩容导致了故障,而是扩容触发了保护。UIS为了保障数据安全,在存储池健康度低于阈值(例如100%)时,会禁止新建块设备这类可能影响数据一致性的操作。
数据均衡是主要原因:新硬盘加入后,系统会自动在全部硬盘间重新分布数据(Rebalancing)。这个过程会占用大量集群IO带宽,导致部分数据副本同步出现短暂延迟,从而使存储池的健康度从100%下降。
UIS前台的严格校验:UIS管理平台(前台)对存储池的健康度有严格要求。当健康度不为100%时,就会禁止新建块设备。而ONEStor存储后台的管理界面,可能对健康度的要求没那么严格,所以有时能创建。
请按照以下顺序操作,从最可能的原因开始排查:
第一步:检查数据池健康度与均衡状态
这是最关键的一步。登录UIS前台,查看该数据池的健康度。如果不是100%(如常见的4%、49%等),或显示为“正在重构/均衡”,说明系统正处于保护状态。
耐心等待:这是最常见的情况。数据均衡可能需要数小时甚至数天,具体时间取决于数据量。请耐心等待均衡完成,期间尽量不要进行其他存储配置操作。你可以通过监控集群的IO负载来大致判断进度。
检查任务:在UIS后台任务中心,查看是否有正在运行的“数据均衡”或“数据重构”任务。
第三步:检查节点间配置一致性
如果数据均衡已完成、硬盘状态也正常,问题可能出在节点配置上。确保集群内所有节点的配置(尤其是硬盘数量、类型和大小)尽量保持一致。如果各节点硬盘数量差异过大(例如超过20%),存储可能无法正常加入原有硬盘池。
尝试通过ONEStor后台创建(临时绕过):如果急需创建块设备且确认集群健康,可以尝试登录ONEStor存储管理后台进行创建。这是一个已知的临时绕过方法,可以规避UIS前台的严格校验。但请谨慎操作。
联系官方技术支持:如果以上所有步骤都无法解决问题,特别是在E0742P03这个版本上,建议直接联系H3C技术支持(400-810-0504)。排查时,请准备好以下信息以便快速定位:
集群版本:明确告知是 UIS V7.0 (E0742P03)。
问题现象:描述“扩容硬盘后数据池异常,无法新建块设备”。
关键日志:从后台节点收集 /var/log/storage/ 目录下的相关日志,尤其是 PEON/PEON.log。
操作步骤:详细说明你已执行的排查步骤和观察到的现象。
暂无评论
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
暂无评论