• 全部
  • 经验案例
  • 典型配置
  • 技术公告
  • FAQ
  • 漏洞说明
  • 全部
  • 全部
  • 大数据引擎
  • 知了引擎
产品线
搜索
取消
案例类型
发布者
是否解决
是否官方
时间
搜索引擎
匹配模式
高级搜索

UIS+硬盘uuid

5小时前提问
  • 0关注
  • 0收藏,23浏览
粉丝:0人 关注:0人

问题描述:

UIS平台上有硬盘坏了要更换,但是进入这个坏的ceph查看不了uuid,报输入输出错误,我就查不到缓存在哪个sdf上面。之前有硬盘坏都是正常查询的

2 个回答
粉丝:13人 关注:9人

排查步骤&命令
1. 先查物理盘对应关系
登录UIS计算/存储节点,执行lsblk -o NAME,SERIAL,UUID,MOUNTPOINT,结合smartctl -a /dev/sdX(需装smartmontools),通过硬盘序列号匹配UIS平台告警的故障盘物理槽位,确认故障盘盘符(如sdf)。
2. 查Ceph OSD对应盘符
执行ceph osd tree(若ceph命令报错,用systemctl status ceph-osd@*看异常OSD),再执行ls -l /var/lib/ceph/osd/ceph-*/block,通过软链接指向的/dev路径,匹配故障盘对应的OSD ID。
3. 获取硬盘UUID
若盘已IO错误无法直接查,从UIS平台【存储管理-磁盘列表】找对应槽位硬盘的UUID;或从节点/etc/ceph/ceph.conf、OSD目录的whoami+fsid文件关联OSD的UUID;也可通过udevadm info --query=all --name=/dev/sdf | grep UUID(盘未完全挂死时可用)。
4. 更换后操作
替换硬盘后,按UIS官方步骤删除故障OSD、清理磁盘、重新添加OSD即可。

暂无评论

粉丝:27人 关注:2人

UIS ONEStor 硬盘 I/O 错误,无法读取磁盘 UUID,定位故障盘
现象:硬盘硬件损坏报 Input/output error,blkid、lsblk读不出该盘 UUID;无法通过读取磁盘本身获取 UUID;不能读坏盘本身,要从集群元数据、平台、系统日志反向定位 OSD‑ID、盘符、槽位。
⚠️磁盘已经硬件 IO 错误,不要再去读这块盘,避免内核报错、节点卡顿。
步骤 1:先拿到故障 OSD ID(不访问坏盘)
方式 A:UIS Web 界面(优先)
存储 → 存储池 → OSD 列表,找到down状态 OSD,记下OSD_ID,同时确认该 OSD 属于哪一个存储节点。
方式 B:SSH 登录任意 CVM/mon 节点执行
bash
ceph osd tree | grep down
#或者
ceph osd stat
输出示例 osd.12 down 0.00000 0.00000 0,拿到 OSD_ID=12。
注意:此时不要执行 ceph osd metadata osd.12,部分 UIS 版本会尝试访问故障磁盘,直接报 I/O 错误卡死终端。
步骤 2:登录该故障 OSD 所在的节点 SSH
2.1 查找该节点上 OSD 目录元数据(元数据存在系统盘,不在坏的数据盘上,可以正常读)
ONEStor/UIS,OSD 元数据目录:/var/lib/ceph/osd/ceph‑$OSDID/
bash
#替换为你的osd id,例如ceph‑12
ls /var/lib/ceph/osd/ceph‑12/
#查看whoami、fsid,拿到OSD内部fsid(不是磁盘硬件UUID)
cat /var/lib/ceph/osd/ceph‑12/fsid
cat /var/lib/ceph/osd/ceph‑12/whoami
❗此时不要执行 lsblk /dev/sdX、blkid 去读取故障盘,会触发 I/O error。
2.2 查看软链接,确认原来绑定的盘符(关键点)
bash
ls -l /var/lib/ceph/osd/ceph‑12/block
输出类似:
block -> /dev/sdf
就算磁盘已经 IO 故障,软链接记录还保留,直接就能看到原来对应 /dev/sdf,这就是你要找的盘符,不需要读盘本身。
历史正常盘:block 链接指向磁盘;磁盘硬件损坏后,链接文件还在,只是访问 /dev/sdf 会 I/O 报错。
步骤 3:确认物理槽位(防止 sd 盘符漂移,不要只信 sdf)
方案 1:UIS Web 硬件监控(推荐)
主机 → 对应故障节点 →硬件监控→硬盘,页面直接看到故障硬盘SN 序列号、槽位号,还可以点击【磁盘点灯】,机房定位物理盘,不需要命令行读坏盘。
方案 2:系统内核日志定位哪个 sdX 报 I/O 错误
bash
dmesg | grep -i "I/O error"
#或者
grep -i "Buffer I/O error" /var/log/messages
日志会打印:Buffer I/O error on device sdf,确认报错的盘符就是 sdf,和上面软链接结果对应上。
方案 3:RAID 卡工具看槽位(确认物理盘,防止盘符漂移)
bash
#LSI RAID卡
storcli64 /c0 show all
#PMC阵列卡
arcconf getconfig 1 ld
步骤 4:UIS 平台标准换盘流程(重点,不要手动操作 ceph 底层)
UIS 不要手工 ceph osd purge,走平台退役磁盘流程。
UIS 网页:存储 →磁盘,选中该故障磁盘,执行【退役磁盘】,平台自动处理 OSD 下线、数据重平衡。
热插拔更换新硬盘。
新硬盘接入后,执行【扫描磁盘】,再添加到存储池,复用原来 OSD ID。
⚠️磁盘硬件彻底损坏,磁盘本身的 UUID 已经读不到,不需要获取磁盘 UUID;UIS 平台靠 OSD_ID、SN、槽位管理,换盘不需要旧盘 UUID。
常见踩坑
❌blkid /dev/sdf:磁盘硬件损坏,会报 I/O error,读不出 UUID,不要反复执行。
❌不要去 mount 故障盘,会节点卡死。
✅靠/var/lib/ceph/osd/ceph‑XX/block软链接,系统盘保存的链接,不需要访问坏的数据盘,直接拿到原盘符。
✅优先 Web 硬件监控看 SN + 点灯,避免 sd 盘符漂移导致拔错盘。
应急异常:block 软链接丢失
如果软链接也没了:
Web 界面拿到故障硬盘 SN、槽位;
直接机房点灯定位物理盘,直接拔盘;
UIS 平台做磁盘退役。
这种场景完全不需要磁盘 UUID,UIS 平台以硬件 SN / 槽位识别。

暂无评论

编辑答案

你正在编辑答案

如果你要对问题或其他回答进行点评或询问,请使用评论功能。

分享扩散:

提出建议

    +

亲~登录后才可以操作哦!

确定

亲~检测到您登陆的账号未在http://hclhub.h3c.com进行注册

注册后可访问此模块

跳转hclhub

你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作

举报

×

侵犯我的权益 >
对根叔社区有害的内容 >
辱骂、歧视、挑衅等(不友善)

侵犯我的权益

×

泄露了我的隐私 >
侵犯了我企业的权益 >
抄袭了我的内容 >
诽谤我 >
辱骂、歧视、挑衅等(不友善)
骚扰我

泄露了我的隐私

×

您好,当您发现根叔知了上有泄漏您隐私的内容时,您可以向根叔知了进行举报。 请您把以下内容通过邮件发送到pub.zhiliao@h3c.com 邮箱,我们会尽快处理。
  • 1. 您认为哪些内容泄露了您的隐私?(请在邮件中列出您举报的内容、链接地址,并给出简短的说明)
  • 2. 您是谁?(身份证明材料,可以是身份证或护照等证件)

侵犯了我企业的权益

×

您好,当您发现根叔知了上有关于您企业的造谣与诽谤、商业侵权等内容时,您可以向根叔知了进行举报。 请您把以下内容通过邮件发送到 pub.zhiliao@h3c.com 邮箱,我们会在审核后尽快给您答复。
  • 1. 您举报的内容是什么?(请在邮件中列出您举报的内容和链接地址)
  • 2. 您是谁?(身份证明材料,可以是身份证或护照等证件)
  • 3. 是哪家企业?(营业执照,单位登记证明等证件)
  • 4. 您与该企业的关系是?(您是企业法人或被授权人,需提供企业委托授权书)
我们认为知名企业应该坦然接受公众讨论,对于答案中不准确的部分,我们欢迎您以正式或非正式身份在根叔知了上进行澄清。

抄袭了我的内容

×

原文链接或出处

诽谤我

×

您好,当您发现根叔知了上有诽谤您的内容时,您可以向根叔知了进行举报。 请您把以下内容通过邮件发送到pub.zhiliao@h3c.com 邮箱,我们会尽快处理。
  • 1. 您举报的内容以及侵犯了您什么权益?(请在邮件中列出您举报的内容、链接地址,并给出简短的说明)
  • 2. 您是谁?(身份证明材料,可以是身份证或护照等证件)
我们认为知名企业应该坦然接受公众讨论,对于答案中不准确的部分,我们欢迎您以正式或非正式身份在根叔知了上进行澄清。

对根叔社区有害的内容

×

垃圾广告信息
色情、暴力、血腥等违反法律法规的内容
政治敏感
不规范转载 >
辱骂、歧视、挑衅等(不友善)
骚扰我
诱导投票

不规范转载

×

举报说明