Khái niệm: Cluster · Quorum · HA
Cluster gộp nhiều node PVE để quản lý chung, chia sẻ cấu hình (qua corosync + pmxcfs) và di chuyển VM giữa các node. Quorum là cơ chế "đa số phiếu" giúp cluster tránh split-brain — cần > 50% số node online. HA (High Availability) tự khởi động lại VM trên node còn sống khi 1 node chết.
HA cần shared storage
Để VM chạy lại được ở node khác, disk VM phải nằm trên storage dùng chung: Ceph, NFS, iSCSI, hoặc ZFS Replication. Disk local (không replicate) thì HA không di chuyển được.
Tạo Cluster (trên node đầu)
~2 phút
Datacenter → Cluster → Create Cluster
Đặt Cluster Name · chọn network cho corosync (nên là mạng ổn định, tách khỏi storage traffic) → Create.
Join các node khác vào Cluster
~5 phút mỗi node
-
1
Lấy Join Information (node 1)
Datacenter → Cluster → Join Information → Copy chuỗi.
-
2
Join (trên node 2, 3...)
Đăng nhập GUI node cần join → Datacenter → Cluster → Join Cluster → Paste + nhập root password của node 1 → Join.
-
3
Kiểm tra
Sau vài giây, mở GUI bất kỳ node → panel trái hiện tất cả node. Datacenter → Cluster phải thấy Quorate = Yes.
Node join phải "sạch"
Node đang có VM/CT KHÔNG join được (join yêu cầu node trống VM). Tạo VM sau khi đã lập cluster.
QDevice cho cụm 2 node (tùy chọn)
~5 phút — giải quyết bài toán quorum số chẵn
Cụm 2 node: mất 1 node là mất quorum (1/2 < đa số) → cluster đứng. QDevice (chạy trên 1 máy thứ 3 nhỏ, kể cả Raspberry Pi) cấp thêm 1 phiếu để giữ quorum khi 1 node chết.
Cụm ≥ 3 node (lẻ) thì KHÔNG cần QDevice — đã có quorum tự nhiên.
Cấu hình HA (Group + Resource)
~10 phút
-
1
Tạo HA Group
Datacenter → HA → Groups → Create: ID · chọn node + priority (số cao = ưu tiên chạy) · tick restricted (chỉ các node này) · nofailback (không tự chuyển ngược khi node cũ sống lại).
-
2
Thêm HA Resource
Datacenter → HA → Resources → Add: chọn VM/CT ID · Group vừa tạo · State = started · Max Restart / Max Relocate.
| Request State | Ý nghĩa |
|---|---|
| started | Luôn giữ VM chạy (khởi động lại/di chuyển khi cần) |
| stopped | Giữ VM tắt nhưng vẫn quản lý HA |
| disabled | Tạm ngưng quản lý HA cho resource |
Test Failover & quản lý
~5 phút
-
1
Mô phỏng node lỗi
Tắt cứng node đang chạy VM (IPMI power off). Sau ~1–2 phút HA khởi động lại VM ở node khác. Theo dõi Datacenter → HA → Status.
-
2
Bảo trì node (không kích hoạt HA nhầm)
Trước khi reboot node có kế hoạch: dùng Migrate VM sang node khác, hoặc node → Bulk Actions → Migrate All. Có thể dùng CLI
ha-manager crm-command node-maintenance enable <node>.
Hoàn tất
Cluster + HA đã hoạt động qua Web GUI. Kết hợp shared storage là có hạ tầng chịu lỗi node.
Troubleshooting
| Triệu chứng | Xử lý |
|---|---|
| Join fail / timeout | Node join phải trống VM; kiểm tra kết nối + đồng bộ giờ (NTP) giữa các node |
| Cluster mất quorum | Quá nửa node offline → khôi phục node, hoặc dùng QDevice cho cụm 2 node |
| HA không di chuyển VM | Disk VM là local, không shared → chuyển sang Ceph/NFS/ZFS-replication |
| Corosync log lỗi | journalctl -u corosync -e · pvecm status |