• 全部
  • 经验案例
  • 典型配置
  • 技术公告
  • FAQ
  • 漏洞说明
  • 全部
  • 全部
  • 大数据引擎
  • 知了引擎
产品线
搜索
取消
案例类型
发布者
是否解决
是否官方
时间
搜索引擎
匹配模式
高级搜索

超融合平台部分物理机搬迁

3天前提问
  • 0关注
  • 0收藏,110浏览
粉丝:0人 关注:0人

问题描述:

原本10台物理机组成的一个超融合集群,现在因为实际原因需要迁移其中的四台物理机,请问是否可行以及详细的方案

3 个回答
粉丝:13人 关注:9人

可行,需遵循以下步骤:
1. 确认集群状态:
检查集群健康状态:hci cluster show
确认剩余6台物理机资源(CPU、内存、存储)满足现有业务需求:hci host resource show
2. 迁移虚拟机:
将待搬迁物理机上的所有虚拟机在线迁移至其他物理机:hci vm migrate --target-host
若无法在线迁移,可关机后迁移:hci vm poweroff ,再执行迁移命令。
3. 移除待搬迁物理机:
确保待搬迁物理机无运行虚拟机后,将其从集群中移除:hci host remove
4. 物理搬迁:
断电、拆除待搬迁物理机,搬迁至新位置。
5. 重新加入集群(若需):
若搬迁后需重新加入原集群,在新位置配置网络(与原集群同网段),执行:hci host add --cluster
若无需重新加入,可单独部署或加入其他集群。
注意事项:
迁移前备份关键数据。
确保剩余节点资源充足,避免业务中断。
网络配置需与原集群一致(VLAN、IP等)。
操作前建议在测试环境验证流程。

暂无评论

粉丝:27人 关注:1人

针对您“将10台超融合集群中的4台物理机搬迁”的需求,这在技术上是完全可行的,但属于高风险的架构调整操作。超融合架构(HCI)的计算、存储和网络高度融合,直接搬迁物理机可能导致数据副本不足、集群脑裂甚至业务中断。
为了确保业务连续性和数据安全,建议严格遵循“评估-腾挪-搬迁-重组”的标准流程。以下是为您整理的详细实施方案:

第一阶段:搬迁前评估与规划

  1. 集群健康与容量评估:检查当前集群的整体健康状态,确认剩余6台物理机的资源(CPU、内存、存储)足以承载搬迁的4台物理机上的所有虚拟机负载。
  2. 硬件亚健康排查:对计划搬迁的4台物理机进行全面的硬件体检,提前排查内存错误、磁盘IO异常或网络亚健康等隐患,避免搬迁后在新机房出现故障。
  3. 制定搬迁计划:明确搬迁的时间窗口(建议安排在夜间或业务低峰期),并制定详细的应急预案和回滚计划。

第二阶段:资源腾挪(核心步骤)

在物理机下电搬迁前,必须将其上的业务和数据全部转移至剩余的6台节点上:
  1. 虚拟机热迁移:利用超融合平台的热迁移功能,将这4台物理机上的虚拟机平滑迁移至其他健康的宿主机上。建议安排在夜间低峰期执行,实现业务无感知。
  2. 存储数据重平衡:虚拟机迁移后,超融合底层的分布式存储会自动或手动触发数据重平衡(Rebalance),将原本存储在这4台机器上的数据副本同步到其他节点,确保数据冗余度恢复正常。
  3. 安全退出集群:确认虚拟机已全部迁走且数据重平衡完成后,通过管理平台将这4台物理机安全、优雅地移出超融合集群。

第三阶段:物理搬迁与重组

  1. 规范下电与搬运:按照标准流程关闭这4台物理机,断开网络与电源连线,做好标签标记后进行物理搬运。
  2. 新环境上架与网络配置:在新机房完成上架,连接电源与网络。务必确保新环境的网络拓扑、VLAN划分、IP地址规划与原集群保持一致。
  3. 重新加入集群:将物理机开机,通过超融合管理平台将其重新纳管并加入集群。系统会自动进行底层存储的数据同步与平衡,直至集群状态恢复为“健康”。

⚠️ 关键风险提示

  • 数据丢失风险绝对禁止在未迁移虚拟机或未等待数据重平衡完成的情况下,直接强制下电或移除物理机,这会导致不可逆的数据丢失。
  • 厂商支持:不同品牌的超融合平台(如深信服、SmartX、Nutanix等)在节点退出和重组的底层机制上存在差异。强烈建议在执行前联系您的超融合原厂技术支持,获取针对您具体软件版本的官方操作指导。

暂无评论

粉丝:25人 关注:2人

10 节点 UIS 集群迁出 4 台物理机完全可行,缩容后剩余 6 节点,满足 UIS 分布式存储 MON 监控节点≥3、三副本冗余架构安全基线;
整体分为两种业务场景:
  1. 场景 A(推荐):迁出的 4 台主机彻底脱离原集群、搬迁至新机房组成全新独立 UIS 集群;
  2. 场景 B:4 台主机搬迁后后期还要重新加回原集群(保留集群归属)。
    约束前提:原集群默认三副本存储架构、缩容全程保证集群始终 HEALTH_OK,分批移出,严禁一次性下线多台节点。

一、前置安全校验(操作前必须完成)

1. 集群基线核查

  1. 登录任意 CVK 节点执行 ceph -s,必须为 HEALTH_OK,无 PG 异常、无 OSD 离线、无回填 / 恢复任务;
  2. 确认存储副本策略:默认 3 副本,10 节点缩至 6 节点,剩余节点数量充足,不会触发副本降级风险;
  3. 查看 MON 监控节点数量:原有监控节点≥3,移除 4 台节点后系统会自动补充 MON 角色,保证仲裁正常;
  4. 集群剩余总容量使用率建议<75%,避免节点移除后数据均衡撑满磁盘。

2. 预配置调整

  1. 临时调高数据均衡限速,防止迁移虚拟机 + 存储重平衡抢占带宽:
bash
ceph tell osd.* injectargs '--osd_recovery_max_active 3' ceph tell osd.* injectargs '--osd_backfill_max_active 2'
  1. 关闭集群 DRS 自动调度、临时关闭 HA 故障自动重启(避免维护阶段虚拟机乱迁移);
  2. 检查迁出 4 台主机上所有NAS 共享盘、绑定主机的快照、定时备份任务、存储分层任务,解绑或迁移至其余 6 台节点。

二、场景 A:4 台节点永久脱离原集群、搬迁新建集群(主流方案)

整体原则:单次只处理 1 台主机,该主机全部虚拟机迁出→进入维护模式→删除主机→下电搬迁,完成一台再处理下一台,4 台分 4 轮执行。

单台主机标准完整步骤

阶段 1:清空主机上运行的虚拟机(零中断热迁移)

  1. UIS 页面进入【主机】,选中待迁出主机,右键 进入维护模式,勾选【自动迁移该主机上所有虚拟机至集群其他节点】、关闭数据平衡(关键,防止关机瞬间疯狂均衡数据);
  2. 等待 DRS 自动在线热迁移所有虚拟机,任务台全部迁移成功无报错;
  3. 人工复核:该主机无运行中的虚拟机、无挂载本地盘的虚拟机、无快照 / 克隆驻留。

阶段 2:移除主机 MON 监控角色(防止删节点触发监控不足报错)

  1. 进入【存储】→【分布式存储】→【监控节点】;
  2. 若当前主机为 MON 节点,选中执行移除监控节点
若集群只剩 3 个 MON 无法移除,系统会自动把其他普通节点提升为 MON,无需手动干预。

阶段 3:删除主机(计算 + 存储双层面剔除集群)

  1. 确认集群 ceph -s 健康正常;
  2. 主机更多操作 → 删除主机
    作用:将该主机所有 OSD 踢出存储集群、清理集群元数据,数据自动均衡到剩余 6 台节点,主机彻底脱离集群管理域H3C;
  3. 等待后台数据均衡全部完成,再次确认集群 HEALTH_OK

阶段 4:下电、搬迁、重建新集群

  1. 主机正常关机断电,搬迁至新机房上架接电;
  2. 搬迁后的 4 台服务器重装 UIS CVK 系统(版本必须和原集群一致);
  3. 4 台重新组网搭建全新独立 UIS 集群,部署业务。

循环规则

第 1 台完整走完 → 等待集群数据均衡完毕(根据容量通常 30min~3h)→ 再操作第 2 台,禁止并行处理 2 台及以上节点。

缩容收尾(4 台全部移除完毕)

  1. 查看集群 MON 数量,保证至少 3 个监控节点;
  2. 恢复均衡默认参数、开启 HA、DRS;
  3. 核查虚拟机运行、存储读写、业务连通性,完成验收。

三、场景 B:4 台主机搬迁后未来还要加回原集群(不删除主机,仅离线搬迁)

无需执行「删除主机」,只做离线搬迁,后续可重新上线加入集群:
  1. 主机进入维护模式,自动迁走全部虚拟机,勾选【关闭数据平衡】;
  2. 迁移完成后,正常关闭主机;
  3. 搬迁上架接入机房,管理网、存储网网段保持不变
  4. 开机上电,主机自动重新接入集群、自动重建 OSD、数据恢复;
  5. 集群恢复健康后退出维护模式。
优点:后期可无缝回迁;缺点:搬迁过程中集群长期处于「少 4 个 OSD」降级状态,这段时间如果再坏硬盘会丢数据,不建议长时间离线(离线周期控制在 7 天内)

四、搬迁 4 台节点后,新旧两套集群后续规划

  1. 原 6 节点集群:维持原有业务,三副本架构完整,稳定性不变;
  2. 新 4 节点集群
    • 4 节点建议配置2 副本存储策略(节省空间);
    • 如需和原集群互通业务,两台集群三层打通,使用云彩虹 CloudRainbow跨集群迁移虚拟机;
    • 版本必须保持一致,否则云彩虹迁移失败H3C。

五、关键风险规避(极易踩坑的 5 点)

  1. ❌ 禁止一次性下线 2 台及以上主机
    一次性下线多台 OSD,三副本架构可能出现副本缺失、PG stuck 阻塞,引发集群故障。
  2. ❌ 进入维护模式不勾选「关闭数据平衡」
    关机瞬间集群大量均衡数据,全网带宽打满、业务卡顿甚至数据库事务崩溃。
  3. ❌ 迁出主机残留本地磁盘虚拟机
    带本地磁盘的虚拟机无法热迁移,必须先关机冷迁移,否则维护模式执行失败。
  4. ❌ 搬迁后的旧节点不重装系统直接加入新集群
    残留原集群 Ceph 元数据,会造成新集群 Ceph 冲突、脑裂、数据损坏,必须重装 CVK 清除元数据H3C。
  5. ❌ 缩容完成后集群使用率超过 85%
    剩余 6 台节点容量占比过高,后续硬盘故障没有冗余空间,建议扩容硬盘或清理闲置快照。

六、异常故障处理方案

  1. 删除主机提示「无法删除,监控节点不足」
    进入存储监控页面,手动把集群内空闲节点新增为 MON 监控节点,再执行删除。
  2. 维护模式虚拟机迁移卡住 99%
    排查虚拟机是否挂载光驱、USB 设备、本地盘,移除外设后重新迁移;内存频繁变化的数据库业务建议夜间低峰迁移。
  3. 移除节点后集群出现 undersized 告警
    等待后台数据回填均衡完成即可,不要强行重启节点。

七、两种方案优缺点对比

表格
方案做法优点缺点适用场景
永久剥离新建集群删除主机 + 重装系统原集群始终健康安全,互不干扰无法回迁拆分两套独立业务、永久分开使用
临时离线搬迁仅维护关机搬迁后期可回迁、不用重装系统搬迁期间集群降级,存在数据风险短期搬迁、未来需要合并集群

八、整体工期参考

4 台节点串行处理,每台迁移虚拟机约 0.5~2 小时,每台移除后集群均衡时间 1~3 小时,整套缩容完整执行约 8~16 小时,推荐夜间业务低峰窗口实施。

暂无评论

编辑答案

你正在编辑答案

如果你要对问题或其他回答进行点评或询问,请使用评论功能。

分享扩散:

提出建议

    +

亲~登录后才可以操作哦!

确定

亲~检测到您登陆的账号未在http://hclhub.h3c.com进行注册

注册后可访问此模块

跳转hclhub

你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作

举报

×

侵犯我的权益 >
对根叔社区有害的内容 >
辱骂、歧视、挑衅等(不友善)

侵犯我的权益

×

泄露了我的隐私 >
侵犯了我企业的权益 >
抄袭了我的内容 >
诽谤我 >
辱骂、歧视、挑衅等(不友善)
骚扰我

泄露了我的隐私

×

您好,当您发现根叔知了上有泄漏您隐私的内容时,您可以向根叔知了进行举报。 请您把以下内容通过邮件发送到pub.zhiliao@h3c.com 邮箱,我们会尽快处理。
  • 1. 您认为哪些内容泄露了您的隐私?(请在邮件中列出您举报的内容、链接地址,并给出简短的说明)
  • 2. 您是谁?(身份证明材料,可以是身份证或护照等证件)

侵犯了我企业的权益

×

您好,当您发现根叔知了上有关于您企业的造谣与诽谤、商业侵权等内容时,您可以向根叔知了进行举报。 请您把以下内容通过邮件发送到 pub.zhiliao@h3c.com 邮箱,我们会在审核后尽快给您答复。
  • 1. 您举报的内容是什么?(请在邮件中列出您举报的内容和链接地址)
  • 2. 您是谁?(身份证明材料,可以是身份证或护照等证件)
  • 3. 是哪家企业?(营业执照,单位登记证明等证件)
  • 4. 您与该企业的关系是?(您是企业法人或被授权人,需提供企业委托授权书)
我们认为知名企业应该坦然接受公众讨论,对于答案中不准确的部分,我们欢迎您以正式或非正式身份在根叔知了上进行澄清。

抄袭了我的内容

×

原文链接或出处

诽谤我

×

您好,当您发现根叔知了上有诽谤您的内容时,您可以向根叔知了进行举报。 请您把以下内容通过邮件发送到pub.zhiliao@h3c.com 邮箱,我们会尽快处理。
  • 1. 您举报的内容以及侵犯了您什么权益?(请在邮件中列出您举报的内容、链接地址,并给出简短的说明)
  • 2. 您是谁?(身份证明材料,可以是身份证或护照等证件)
我们认为知名企业应该坦然接受公众讨论,对于答案中不准确的部分,我们欢迎您以正式或非正式身份在根叔知了上进行澄清。

对根叔社区有害的内容

×

垃圾广告信息
色情、暴力、血腥等违反法律法规的内容
政治敏感
不规范转载 >
辱骂、歧视、挑衅等(不友善)
骚扰我
诱导投票

不规范转载

×

举报说明