Cluster & HA Guide · Web GUI

Tạo & Quản lý Cluster & HA
bằng Web GUI

Gộp nhiều node thành 1 cluster, thêm QDevice cho cụm 2 node, cấu hình HA Group + Resource để VM tự chuyển node khi lỗi — toàn bộ trên giao diện web.

5
Bước
Quorum
Corosync
HA
Failover
~30m
Thiết lập

Khái niệm: Cluster · Quorum · HA

Cluster gộp nhiều node PVE để quản lý chung, chia sẻ cấu hình (qua corosync + pmxcfs) và di chuyển VM giữa các node. Quorum là cơ chế "đa số phiếu" giúp cluster tránh split-brain — cần > 50% số node online. HA (High Availability) tự khởi động lại VM trên node còn sống khi 1 node chết.

HA cần shared storage

Để VM chạy lại được ở node khác, disk VM phải nằm trên storage dùng chung: Ceph, NFS, iSCSI, hoặc ZFS Replication. Disk local (không replicate) thì HA không di chuyển được.

B-1

Tạo Cluster (trên node đầu)

~2 phút

1

Datacenter → Cluster → Create Cluster

Đặt Cluster Name · chọn network cho corosync (nên là mạng ổn định, tách khỏi storage traffic) → Create.

B-2

Join các node khác vào Cluster

~5 phút mỗi node

sequenceDiagram participant N1 as Node 1 (đã tạo cluster) participant N2 as Node 2 Note over N1: Cluster → Join Information → Copy Note over N2: Cluster → Join Cluster → Paste N2->>N1: Gửi yêu cầu + root password N1 N1-->>N2: Đồng bộ config (corosync/pmxcfs) Note over N1,N2: Quorum thiết lập
  1. 1

    Lấy Join Information (node 1)

    Datacenter → Cluster → Join Information → Copy chuỗi.

  2. 2

    Join (trên node 2, 3...)

    Đăng nhập GUI node cần join → Datacenter → Cluster → Join Cluster → Paste + nhập root password của node 1 → Join.

  3. 3

    Kiểm tra

    Sau vài giây, mở GUI bất kỳ node → panel trái hiện tất cả node. Datacenter → Cluster phải thấy Quorate = Yes.

Node join phải "sạch"

Node đang có VM/CT KHÔNG join được (join yêu cầu node trống VM). Tạo VM sau khi đã lập cluster.

B-3

QDevice cho cụm 2 node (tùy chọn)

~5 phút — giải quyết bài toán quorum số chẵn

Cụm 2 node: mất 1 node là mất quorum (1/2 < đa số) → cluster đứng. QDevice (chạy trên 1 máy thứ 3 nhỏ, kể cả Raspberry Pi) cấp thêm 1 phiếu để giữ quorum khi 1 node chết.

# Trên máy thứ 3 (Debian/Ubuntu) làm QDevice apt install corosync-qnetd # Trên CẢ 2 node PVE, cài client apt install corosync-qdevice # Trên 1 node PVE, add QDevice (IP máy thứ 3) pvecm qdevice setup 192.168.10.50

Cụm ≥ 3 node (lẻ) thì KHÔNG cần QDevice — đã có quorum tự nhiên.

B-4

Cấu hình HA (Group + Resource)

~10 phút

  1. 1

    Tạo HA Group

    Datacenter → HA → Groups → Create: ID · chọn node + priority (số cao = ưu tiên chạy) · tick restricted (chỉ các node này) · nofailback (không tự chuyển ngược khi node cũ sống lại).

  2. 2

    Thêm HA Resource

    Datacenter → HA → Resources → Add: chọn VM/CT ID · Group vừa tạo · State = started · Max Restart / Max Relocate.

Request StateÝ nghĩa
startedLuôn giữ VM chạy (khởi động lại/di chuyển khi cần)
stoppedGiữ VM tắt nhưng vẫn quản lý HA
disabledTạm ngưng quản lý HA cho resource
B-5

Test Failover & quản lý

~5 phút

  1. 1

    Mô phỏng node lỗi

    Tắt cứng node đang chạy VM (IPMI power off). Sau ~1–2 phút HA khởi động lại VM ở node khác. Theo dõi Datacenter → HA → Status.

  2. 2

    Bảo trì node (không kích hoạt HA nhầm)

    Trước khi reboot node có kế hoạch: dùng Migrate VM sang node khác, hoặc node → Bulk Actions → Migrate All. Có thể dùng CLI ha-manager crm-command node-maintenance enable <node>.

Hoàn tất

Cluster + HA đã hoạt động qua Web GUI. Kết hợp shared storage là có hạ tầng chịu lỗi node.

Troubleshooting

Triệu chứngXử lý
Join fail / timeoutNode join phải trống VM; kiểm tra kết nối + đồng bộ giờ (NTP) giữa các node
Cluster mất quorumQuá nửa node offline → khôi phục node, hoặc dùng QDevice cho cụm 2 node
HA không di chuyển VMDisk VM là local, không shared → chuyển sang Ceph/NFS/ZFS-replication
Corosync log lỗijournalctl -u corosync -e · pvecm status

Bài liên quan