Logo

Personal Ops Runbook

Personal runbook covering infrastructure operations for Cloud, Kubernetes, OpenStack, and Ceph environments. Includes deployment and teardown procedures, node management, cluster monitoring setup, and incident response workflows compiled from day-to-day operational work. Intended strictly for personal reference — configurations and scripts are environment-specific and not guaranteed to work as-is elsewhere.

PROFILE: mclock_scheduler.conf (FULL)

Config

osd_mclock_scheduler_client_res 0.7
osd_mclock_scheduler_client_lim 0
osd_mclock_scheduler_client_wgt 4

osd_mclock_scheduler_background_recovery_res 0.2
osd_mclock_scheduler_background_recovery_lim 0.4
osd_mclock_scheduler_background_recovery_wgt 1

osd_mclock_scheduler_background_best_effort_res 0.1
osd_mclock_scheduler_background_best_effort_lim 0.3
osd_mclock_scheduler_background_best_effort_wgt 1

Tình huống

Disk bench 300 IOPS nhưng thực tế chỉ đạt 200 IOPS. Set FULL res 0.7/0.2/0.1 = 1.0.

  • Client: res 0.7 → SÀN 210 | wgt 4 | lim 0 (không limit)
  • Recovery: res 0.2 → SÀN 60 | wgt 1 | lim 0.4 → limit 120
  • Best: res 0.1 → SÀN 30 | wgt 1 | lim 0.3 → limit 90

Phần dư sẽ được wgt phân chia nhưng vì đang FULL (Σres = 1.0) nên không có dư để chia — chỉ khi một nhóm nào đó workload thấp hoặc không có workload thì phần res của nhóm đó mới dư ra để chia.

Tình huống 1: Workload cao ở cả 3 nhóm (full contention)

Tổng cả 3 nhóm 210 + 60 + 30 = 300 đã hết sạch capacity
→ Không còn  để wgt phân chia
→ Năng lực bench 300: 210 / 60 / 30 Năng lực thật 200: 140 / 40 / 20

Tình huống 2: Workload client + recovery cao, best thấp

Phần res 30 của best bỏ trống thành  30  chia 30 đó theo wgt 4:1:1 (tổng 4+1+1 = 6 suất)
Chia  30 theo wgt [client 4 : recovery 1]  client 4/5 × 30 = 24, recovery 1/5 × 30 = 6 Năng lực bench 300: client 234, recovery 66 Năng lực thật 200: client 156, recovery 44 Đây  thời điểm wgt 4:1  tác dụng  miếng bánh  chia chỉ vỏn vẹn 30 (đúng bằng res của nhóm đang vắng)

Tình huống 3: Workload client thấp, recovery và best cao

Phần res 210 của client bỏ trống thành  210, chia 1:1 cho recovery + best nhưng bị đụng trần  recovery limit  120, best limit  90 Recovery chắc chắn leo tới 120 Best chắc chắn leo tới 90  Tổng 210 > 200 nên sẽ co nhẹ về ~114/86
→  đây lim cắn trước, wgt gần như không kịp  vai trò 

PROFILE: mclock_scheduler.conf (Chia dư)

Config

osd_mclock_scheduler_client_res 0.5
osd_mclock_scheduler_client_lim 0
osd_mclock_scheduler_client_wgt 4

osd_mclock_scheduler_background_recovery_res 0.15
osd_mclock_scheduler_background_recovery_lim 0.4
osd_mclock_scheduler_background_recovery_wgt 1

osd_mclock_scheduler_background_best_effort_res 0.05
osd_mclock_scheduler_background_best_effort_lim 0.3
osd_mclock_scheduler_background_best_effort_wgt 1

Tình huống

Disk bench 300 iops nhưng thực tế chỉ đạt 200 iops. Chừa dư res 0.5/0.15/0.05 = 0.7 (dư 0.3 = 90 iops).

  • Client: res 0.5 → SÀN 150 | wgt 4 | lim 0 (không limit)
  • Recovery: res 0.15 → SÀN 45 | wgt 1 | lim 0.4 → limit 120
  • Best: res 0.05 → SÀN 15 | wgt 1 | lim 0.3 → limit 90

★ Điểm khác cốt lõi là luôn có 90 iops dư chưa hứa cho ai, nó luôn tồn tại kể cả lúc workload cao nhất → wgt có cái để chia mọi lúc.

Tình huống 1: Workload cao ở cả 3 nhóm (full contention)

  Tổng cả 3 nhóm 150 + 45 + 15 = 210   90 (set-full thì không  )
  Lúc này wgt 4:1:1 chia 90  client 4/6*90 = 60, recovery 1/6*90 = 15, best 1/6*90 = 15.
   Năng lực bench 300: client 210 / recovery 60 / best 30
   Năng lực thật 200: client 140 / recovery 40 / best 20
   Con số  bản giống bản set-full (140/40/20),  do client vẫn đạt 140  nhờ sàn đang  mức 150   wgt kéo thêm nữa

Tình huống 2: Workload client + recovery cao, best thấp

Luôn   90 + 15 do không  workload của best  tổng 105
Chia 105 theo wgt 4:1  client 4/5*105=84, recovery 1/5*105=21 Năng lực bench 300: client 234 / recovery 66 Năng lực thật 200: client 156 / recovery 44

Tình huống 3: Workload client thấp, recovery và best cao

Do workload client thấp hoặc không  nên  lượng  khổng lồ nhưng recovery + best đụng limit trước (recovery limit 120, best limit 90) recovery chắc chắn leo tới 120, best chắc chắn leo tới 90 (giống set-full   lim cắn trước wgt)

Vậy khác biệt nằm ở đâu?

Set-full ép buộc phải dùng res, wgt không có tác dụng.

  • Khi set-full mà muốn chỉnh ưu tiên client, không có lựa chọn nào khác ngoài sửa res mà res là cái thứ rất nguy hiểm
  • Khi chừa dư wgt có giá trị → có một lựa chọn an toàn để chỉnh.

Hiệu năng

  • Cả hai chạy hiệu quả như nhau ở vận hành bình thường — SÀN gần như y hệt.
  • Khác biệt là chừa dư an toàn hơn khi vận hành.

Điều gì xảy ra khi cố ý set hiệu năng disk quá thấp hoặc cao

Trường hợp quá cao

Set cao quá không bao giờ chạm tới lim → recovery/scrub vẫn thả ga lúc client thấp → dễ slow op

  • Lúc full contention, set cao hay thấp đều như nhau, ví dụ cả 3 nhóm workload cáo, nếu set HDD = 1000:
  • 500 / 150 / 50, dư 300, chia 4:1:1 → nominal 700 / 200 / 100 (tỉ lệ 7:2:1).
  • Disk thật 200 co lại → client 140 / recovery 40 / best 20.

Y hệt bản set 300 tỉ lệ sẽ tự co, con số capacity không đổi kết quả ở đây ← đây là cái làm tưởng set bao nhiêu cũng được.

Về lim, công thức lim = phần trăm × con số iops đã khai báo. Ví dụ nếu set 1000 iops cho HDD:

recovery trần = 0.4 × 1000 = 400   (disk thật chỉ 200!)
best trần     = 0.3 × 1000 = 300   (disk thật chỉ 200!)

Kịch bản 3 giờ sáng (client workload thấp, recovery cao) → chính là kịch bản slow-op

set 300 set 1000
recovery trần 0.4×300 = 120 0.4×1000 = 400
so với disk thật 200 120 < 200 400 > 200
recovery thực dùng lúc client vắng tối đa 120 (60% disk) 200 (100% disk!)
queue vào disk luôn có 40% disk rảnh chờ client luôn full
slow op ít hơn nhiều hơn
  • Set 300: recovery bị limit ở 120, nửa đêm disk còn rảnh 40%, queue disk ít hơn → client op bất chợt đến chỉ đợi 1-2 op.
  • Set 1000: trần 400 không bao giờ chạm → recovery thả ga lấp 100% disk → queue disk đầy → slow-op nặng.

Trường hợp quá thấp

  • Do client_lim = max nên nó không bị limit, vẫn tận dụng được hết sức disk thật, client luôn không ảnh hưởng.
  • Recovery + best-effort mới là thứ bị bóp vì trần của chúng (0.4 / 0.3 × iops thấp) co lại quá nhỏ → bị limit dưới mức disk có thể làm. Hệ quả là **disk rảnh (util thấp) mà backfill vẫn bò → lãng phí

Vấn đề cache raid

  • Không nên bỏ cache mà nên sử dụng kết hợp cache + recovery_lim, nhưng điều kiện tiên quyết là cache phải khỏe, kiểm soát nhiệt độ, đồng bộ firmware. Một cache khỏe là tài sản; một cache lỗi là nợ xấu.
  • Cache chủ yếu phục vụ write, read vẫn từ disk.
  • Khi backfill op lớn sẽ lấp cache → sử dụng recovery_lim ép bớt.
  • BlueStore sẽ async các write nhỏ dưới ngưỡng bluestore_prefer_deferred_size_hdd mặc định cỡ 32–64k. Data nhét vào WAL cùng transaction, replay xuống chỗ thật sau. Còn các shard EC 6+2 682k vượt ngưỡng bluestore_prefer_deferred_size_hdd ghi data thẳng xuống block device trước rồi mới commit metadata vào RocksDB sau → client phải chờ đủ cả hai mới nhận được phản hồi.
  • Không bỏ cache client cảm nhận nhanh hơn vì cache RAID đã hứng cú ghi data 682k lẫn cú fsync WAL đều đáp xuống DRAM của controller và được ack trong ~0.5ms thay vì chờ đĩa quay 10–20ms.

  • Controller rất thông minh

  • Gom và sắp xếp lại: Nhiều write nhỏ gần nhau về LBA được gộp, thứ tự xả được sắp theo hành trình đầu từ → random write qua cache nhanh hơn đáng kể so với nhận random write trực tiếp vào disk.
  • Hấp thụ ghi đè: Vùng WAL của RocksDB là ghi vòng tròn trên một dải LBA hẹp — write sau đè write trước ngay trong cache, nhiều op ghi chỉ tốn một lần xả xuống đĩa.

  • Cache sẽ hứng lúc workload tăng rồi tranh thủ lúc workload giảm để xả xuống đĩa mà workload RGW của thường là đúng kiểu này nên ngày thường khi không có backfill thì êm ru. Ngược lại backfill là các op write bán tuần tự, liên tục — 240 MiB/s đều đặn vào các ổ target. Hệ quả khoảng trống mà cache vẫn dùng để xả hàng của client bị recovery chiếm mất. Lúc này chỉ cần client tăng workload đột ngột là là đủ chạm trần cache do chưa kịp flush các op của recovery xuống disk → controller chững lại vài trăm ms → vài op vượt ngưỡng → SLOW_OPS.

  • Việc sử dụng recovery_lim kỳ vọng giúp trả lại khoảng hở cho cache thở. Khi không có backfill thì mClock tuning gần như đứng ngoài cuộc — chẳng có gì để lim chặn, client lim = MAX chạy tự do

Vì sao kết quả Ceph bench luôn cao hơn thực tế của disk

  • Bench tạo op 4k và 4k < ngưỡng bluestore_prefer_deferred_size_hdd (default 32k) → đi đường deferred.
  • Data của các op nhỏ này được nhét vào WAL của RocksDB
  • Được append rồi fsync xuống đĩa và vì ghi tuần tự nên nhanh → IOPS cao hơn thực tế.
  • WAL là là các file log của RocksDB, được ghi theo kiểu nối đuôi tuần tự (append-only); trong một đợt write đầu từ bám trong vùng WAL ghi nối tiếp, không nhảy lung tung → tốc độ ghi nhanh hơn.
  • WAL chưa phải chỗ ở cuối của data vì sau khi fsync WAL xong → ack cho client rồi, lúc này data thực sự vẫn nằm trong WAL và lát sau mới được replay xuống vị trí thật trên block device.
  • Như vậy một write deferred có hai cú ghi đĩa:
  • Append WAL — nhanh, tuần tự → bench đo ở đây
  • Replay ra chỗ thật — async, có thể random, bench gần như không đo tới.

Target (write) hay Source (read) nặng hơn?

Phụ thuộc loại việc:

  • Recovery do MẤT shard (như bạn gỡ osd.301): shard mất phải tái dựng từ ≥6 shard khác → đọc 6, ghi 1 → khuếch đại đọc 6:1. Source nặng.
  • Backfill do thêm node (rebalance): shard vẫn còn, chỉ dời chỗ → copy 1 đọc / 1 ghi (1:1), nhẹ hơn, không cần tái dựng.

Trong trường hợp recovery (6:1): - Target = điểm dồn cho một PG (mọi write đổ vào nó), nhưng max_backfills=1 đã chặn số PG đồng thời → target không quá tải kinh khủng. - Source = mỗi object đọc 1 shard, nhưng một OSD source giữ shard cho rất nhiều PG → bị nhiều cuộc tái dựng đọc cùng lúc, và đọc random (shard rải rác).

Source thường mới là nút nóng, đặc biệt khi nó vừa làm source vừa phục vụ client (kịch bản source-mixed). Đây chính là lý do slow-op có thể nổi lên ở một ổ source chứ không phải target.

1. Concurrency = 1/1, đã xác nhận và đang CẮN

osd_max_backfills = 1
osd_recovery_max_active_hdd = 1   ← bạn ĐÃ override (Reef default là 3)

Tốt — bạn set recovery về 1 thật, không phải 3 như mình lo. Quan trọng hơn là nó đang nghẽn ở "1": trong dump_recovery_reservations của osd.751, phần remote_reservations1 cái in_progress (14.68cs0)8 cái xếp hàng chờ. Tức 9 PG muốn backfill VÀO osd.751 nhưng chỉ 1 được chạy mỗi lần → cap đang là nút thắt thật, backfill bị tuần tự hóa (chậm nhưng nhẹ — đúng ý đồ).

2. Bonus: bạn bắt được Reef ưu tiên degraded > misplaced ngay trên máy

Nhìn priority trong queue: cái in_progressprio 151, còn 7 cái chờ là prio 110. PG đang chạy (14.68c) là undersized+degraded — tức degraded được boost lên 151 và chen trước đám misplaced ở 110. Đây chính là cơ chế "degraded ưu tiên hơn misplaced" của Reef mà ta bàn lý thuyết, giờ thấy bằng số thật.

3. Cách đọc source/target (trả lời "làm sao biết")

Quy tắc: so UP với ACTING theo từng vị trí shard. - ACTING = đang giữ = nguồn (đọc). UP = nơi muốn đến = đích (ghi). - Vị trí lệch nhau → shard đang dời: OSD trong ACTING là source, OSD trong UP là target. - NONE trong ACTING → shard mất → degraded → OSD ở UP vị trí đó là target, 6 OSD ACTING còn lại là source (6:1).

Ví dụ từ chính data của bạn:

14.68c (degraded — 751 là target/GHI):

UP    =[751,808,784,527,420,580,478,469]
ACTING=[NONE,808,784,527,420,580,478,469]

s0 mất → dựng lại lên 751 (ghi); 6 trong {808,784,527,420,580,478,469} bị đọc để tái dựng → 6:1. ✓

14.470 (misplaced — 751 là source/ĐỌC):

UP    =[546,...]  ACTING=[751,...]

s0: đích 546 nhận, 751 bị đọc → 1:1.

4. Phán quyết cho osd.751: nó là SOURCE chủ đạo → lý thuyết của bạn đúng

Để ý hai lệnh cho hai góc nhìn bù nhau: - pg ls-by-osd osd.751 liệt kê PG mà 751 nằm trong ACTING = vai source. Đếm ra 9 PG 751 đang/sắp bị đọc làm nguồn (14.d9, 14.470, 14.9cf, 14.a41, 14.a57, 14.ad6, 14.c80, 14.f68, 14.f90 — tất cả đều misplaced, 1:1). - dump_recovery_reservations (remote) cho thấy 751 làm target (trong UP, chưa vào ACTING nên KHÔNG hiện ở pg ls-by-osd): 1 đang chạy + 8 chờ.

Nên 751 = nguồn đọc cho 9 PG + đích ghi cho 1 PG đang chạy. Read roles áp đảo write roles.

Và đây là mấu chốt bạn nói đúng: max_backfills=1 chỉ chặn phía TARGET (cái queue 8-sâu kia là giới hạn 751-làm-đích). Còn 751-làm-source thì KHÔNG bị cap đó — nó bị đọc bởi 9 cuộc backfill mà nhịp do các OSD đích KHÁC quyết định. Đó chính xác là lý do source là nút nóng không bị khóa: cap bảo vệ phía ghi, nhưng phía đọc thì phơi ra.

5. Toàn cục lúc này: đọc trội ~3:1

Khớp với ceph -s trước: ~21 degraded (6:1 đọc) + ~29 misplaced (1:1). Quy ra "vai":

source-read roles ≈ 21×6 + 29×1 = 155
target-write roles ≈ 21 + 29     = 50
→ đọc : ghi ≈ 3 : 1

Tức ngay bây giờ cluster đang đọc nặng gấp ~3 lần ghi ở tầng recovery, do 21 cuộc tái dựng degraded kéo. Source-side đúng là gánh chính. (Lưu ý: tất cả PG backfill đều thuộc pool 14 = pool EC 6+2 RGW của bạn.)

6. Bước cuối để biến "vai" thành MiB/s thật

Topology đã chứng minh 751 thiên về đọc. Giờ chốt bằng số vật lý — chạy trên host chứa osd.751:

iostat -x 1 <device-của-osd.751>

Dự đoán: rkB/s >> wkB/s, r_await cao, %util gần 100%. Nếu đúng vậy → vòng kiểm chứng khép kín: 751 là ổ source bị đọc random nặng, và nếu nó đồng thời phục vụ client → đó là ổ phát slow-op. Lúc đó muốn cứu client, núm hiệu quả không phải ghì target mà là giảm số cuộc tái dựng đồng thời đọc lên một source — tức cân nhắc giữ recovery_max_active=1 (đang đúng) và đừng nâng max_backfills, vì nâng lên là nhân thêm tải đọc lên đúng những ổ source này.

root@VSTOR-CEPH-MBF9-MON-05:/# ceph config show osd.751 osd_max_backfills 1 root@VSTOR-CEPH-MBF9-MON-05:/# ceph config show osd.751 osd_recovery_max_active_hdd 1 root@VSTOR-CEPH-MBF9-MON-05:/# ceph config show osd.751 osd_recovery_max_active 0

root@VSTOR-CEPH-MBF9-MON-05:/# ceph config dump | grep -E 'max_backfills|recovery_max_active' osd advanced osd_recovery_max_active_hdd 1 osd advanced osd_recovery_max_active_ssd 5

Quan trọng hơn là nó đang nghẽn ở "1": trong dump_recovery_reservations của osd.751, phần remote_reservations có 1 cái in_progress (14.68cs0) và 8 cái xếp hàng chờ. Tức 9 PG muốn backfill VÀO osd.751 nhưng chỉ 1 được chạy mỗi lần → cap đang là nút thắt thật, backfill bị tuần tự hóa (chậm nhưng nhẹ — đúng ý đồ).

Nhìn priority trong queue: cái in_progress là prio 151, còn 7 cái chờ là prio 110. PG đang chạy (14.68c) là undersized+degraded — tức degraded được boost lên 151 và chen trước đám misplaced ở 110. Đây chính là cơ chế "degraded ưu tiên hơn misplaced" của Reef mà ta bàn lý thuyết, giờ thấy bằng số thật.14.68c

root@VSTOR-CEPH-MBF9-MON-05:/# ceph tell osd.751 dump_recovery_reservations { "local_reservations": { "max_allowed": 1, "min_priority": 0, "queues": [], "in_progress": [] }, "remote_reservations": { "max_allowed": 1, "min_priority": 0, "queues": [ { "priority": 110, "items": [ { "item": "14.fb6s4", "prio": 110, "can_preempt": true }, { "item": "14.f48s6", "prio": 110, "can_preempt": true }, { "item": "14.32cs4", "prio": 110, "can_preempt": true }, { "item": "14.54fs2", "prio": 110, "can_preempt": true }, { "item": "14.b56s5", "prio": 110, "can_preempt": true }, { "item": "14.a74s0", "prio": 110, "can_preempt": true }, { "item": "14.301s2", "prio": 110, "can_preempt": true } ] }, { "priority": 151, "items": [ { "item": "14.378s6", "prio": 151, "can_preempt": true } ] } ], "in_progress": [ { "item": "14.68cs0", "prio": 151, "can_preempt": true } ] } }

root@VSTOR-CEPH-MBF9-MON-05:/# ceph pg ls backfilling PG OBJECTS DEGRADED MISPLACED UNFOUND BYTES OMAP_BYTES OMAP_KEYS LOG LOG_DUPS STATE SINCE VERSION REPORTED UP ACTING SCRUB_STAMP DEEP_SCRUB_STAMP LAST_SCRUB_DURATION SCRUB_SCHEDULING 14.18 147176 48248 0 0 441374576375 0 0 2771 3000 active+undersized+degraded+remapped+backfilling 79m 538639'256246 538644:3528865 [774,538,599,454,793,516,731,802]p774 [NONE,538,599,454,793,516,731,802]p538 2026-06-14T18:31:09.119457+0000 2026-06-08T23:05:22.826032+0000 185 periodic scrub scheduled @ 2026-06-15T22:34:14.097667+0000 14.33 147551 133578 0 0 441588749231 0 0 2665 3000 active+undersized+degraded+remapped+backfilling 15m 538622'256665 538644:3574407 [406,544,737,529,924,764,870,562]p406 [406,544,737,529,924,NONE,870,562]p406 2026-06-14T16:01:45.293706+0000 2026-05-04T17:10:08.480738+0000 168 periodic scrub scheduled @ 2026-06-15T23:49:37.515443+0000 14.3d 147609 0 268 0 442655288752 0 0 2798 3000 active+remapped+backfilling 4h 538644'256071 538644:2573487 [600,542,455,429,518,796,865,411]p600 [600,542,455,756,518,796,865,411]p600 2026-06-14T16:00:23.841939+0000 2026-05-01T00:07:03.536610+0000 146 periodic scrub scheduled @ 2026-06-15T17:30:03.750862+0000 14.cd 146788 0 61772 0 439451802523 0 0 2801 3000 active+remapped+backfilling 4h 538623'255833 538644:3446409 [734,563,545,589,775,801,515,881]p734 [734,563,545,589,775,801,868,773]p734 2026-06-14T17:15:43.604115+0000 2026-05-22T17:32:15.763825+0000 233 periodic scrub scheduled @ 2026-06-15T23:47:24.962169+0000 14.1a2 146847 103819 0 0 440859635458 0 0 2839 3000 active+undersized+degraded+remapped+backfilling 40m 538637'255314 538644:2211154 [731,437,456,798,529,408,488,773]p731 [731,437,456,798,529,408,488,NONE]p731 2026-06-14T17:41:10.237487+0000 2026-05-22T20:06:29.060134+0000 184 periodic scrub scheduled @ 2026-06-15T22:10:11.852134+0000 14.1f4 146776 86287 0 0 439488156030 0 0 3310 3000 active+undersized+degraded+remapped+backfilling 48m 538623'253982 538644:3352055 [923,595,452,759,872,472,406,817]p923 [923,595,452,NONE,872,472,406,817]p923 2026-06-14T16:21:05.866064+0000 2026-04-24T19:34:33.596930+0000 174 periodic scrub scheduled @ 2026-06-15T16:42:06.382904+0000 14.1fc 146339 0 286420 0 438943259431 0 0 3195 3000 active+remapped+backfilling 5m 538639'255657 538644:2590984 [877,570,549,586,436,479,532,730]p877 [877,570,773,586,436,479,556,730]p877 2026-06-14T17:49:43.366301+0000 2026-04-29T22:12:52.440191+0000 179 periodic scrub scheduled @ 2026-06-15T23:23:05.978756+0000 14.297 146768 132273 0 0 439600029507 0 0 2673 3000 active+undersized+degraded+remapped+backfilling 18m 538639'255802 538644:3037634 [591,791,929,564,763,534,454,286]p591 [591,791,929,564,NONE,534,454,286]p591 2026-06-14T18:23:34.157584+0000 2026-04-28T17:25:27.062851+0000 161 periodic scrub scheduled @ 2026-06-15T23:15:10.140202+0000 14.2c2 146882 0 44280 0 439971010478 0 0 2685 3000 active+remapped+backfilling 4h 538630'254474 538644:2521508 [473,803,433,768,415,519,497,597]p473 [473,803,433,768,415,519,469,493]p473 2026-06-14T15:26:23.886857+0000 2026-04-26T23:30:48.130270+0000 241 periodic scrub scheduled @ 2026-06-15T22:43:30.031723+0000 14.3c0 147401 0 132635 0 441645608622 0 0 2642 3000 active+remapped+backfilling 33m 538644'256261 538644:2885527 [499,483,543,777,915,516,587,871]p499 [499,483,543,777,915,516,587,758]p499 2026-06-14T16:32:59.382603+0000 2026-05-27T19:24:54.038882+0000 191 periodic scrub scheduled @ 2026-06-15T22:30:33.714684+0000 14.3f9 147555 0 121359 0 440908123639 0 0 2737 734 active+remapped+backfilling 2m 538629'256613 538644:4401284 [913,484,874,557,500,461,809,587]p913 [770,484,874,557,500,461,809,587]p770 2026-06-14T18:06:01.888487+0000 2026-04-19T17:44:09.193222+0000 196 periodic scrub scheduled @ 2026-06-16T04:48:43.972764+0000 14.406 146478 0 51510 0 438361535061 0 0 2641 3000 active+remapped+backfilling 4h 538622'253325 538644:2410965 [540,872,432,561,469,475,514,776]p540 [540,482,432,561,469,763,514,776]p540 2026-06-14T16:15:24.385336+0000 2026-04-21T23:19:53.108069+0000 192 periodic scrub scheduled @ 2026-06-16T02:31:01.164789+0000 14.417 147146 0 24331 0 441490288310 0 0 2875 3000 active+remapped+backfilling 69m 538644'254120 538644:2539517 [430,562,733,785,472,422,921,592]p430 [773,562,733,785,472,422,921,592]p773 2026-06-14T16:30:25.184427+0000 2026-05-21T21:20:57.732536+0000 246 periodic scrub scheduled @ 2026-06-15T17:06:40.633099+0000 14.470 147461 0 16125 0 443774591808 0 0 2719 3000 active+remapped+backfilling 5h 538623'256357 538644:3159419 [546,421,525,487,914,601,455,866]p546 [751,421,557,487,914,601,455,527]p751 2026-06-14T16:10:08.006352+0000 2026-06-07T19:38:13.233076+0000 189 periodic scrub scheduled @ 2026-06-16T02:01:33.253444+0000 14.4de 147039 0 68562 0 440609624338 0 0 3055 2216 active+remapped+backfilling 2h 538630'255674 538644:2940135 [881,780,454,727,559,815,423,590]p881 [881,780,454,727,559,760,423,590]p881 2026-06-14T17:23:13.833078+0000 2026-04-28T17:10:49.160225+0000 141 periodic scrub scheduled @ 2026-06-15T21:24:34.689281+0000 14.507 146145 0 31276 0 438424181253 0 0 2713 3000 active+remapped+backfilling 15m 538620'253927 538644:2731222 [753,917,869,557,431,729,410,787]p753 [753,917,516,557,431,729,410,787]p753 2026-06-14T17:18:17.444639+0000 2026-04-25T22:19:49.358634+0000 174 periodic scrub scheduled @ 2026-06-16T04:47:45.736388+0000 14.561 146963 5961 0 0 440653208107 0 0 2743 3000 active+undersized+degraded+remapped+backfilling 2h 538644'255182 538644:2667942 [475,767,427,601,783,732,571,546]p475 [475,NONE,427,601,783,732,571,546]p475 2026-06-14T18:17:58.854540+0000 2026-05-01T19:45:27.318523+0000 157 periodic scrub scheduled @ 2026-06-16T06:04:55.814751+0000 14.5cc 147721 0 108147 0 442824236291 0 0 3106 3000 active+remapped+backfilling 70m 538625'255788 538644:3085591 [789,574,421,799,516,557,591,429]p789 [789,574,421,799,516,557,773,429]p789 2026-06-14T17:31:49.020895+0000 2026-05-01T19:31:50.575263+0000 142 periodic scrub scheduled @ 2026-06-15T18:51:05.492624+0000 14.5ce 146891 0 105131 0 440401894736 0 0 2593 3000 active+remapped+backfilling 74m 538639'254560 538644:2860796 [532,491,503,406,810,444,468,865]p532 [532,491,503,759,810,444,468,865]p532 2026-06-14T18:00:34.333964+0000 2026-05-18T16:45:44.889763+0000 249 periodic scrub scheduled @ 2026-06-16T03:08:59.695692+0000 14.67b 147086 0 80061 0 440868959022 0 0 2853 3000 active+remapped+backfilling 115m 538625'254831 538644:2865875 [463,490,909,795,729,432,876,544]p463 [463,490,909,753,729,432,876,544]p463 2026-06-14T18:39:23.782411+0000 2026-05-28T01:09:48.154392+0000 146 periodic scrub scheduled @ 2026-06-15T23:51:11.447072+0000 14.68c 146915 87252 0 0 440823330497 0 0 3108 3000 active+undersized+degraded+remapped+backfilling 70m 538623'255169 538644:2681039 [751,808,784,527,420,580,478,469]p751 [NONE,808,784,527,420,580,478,469]p808 2026-06-14T15:38:50.575425+0000 2026-04-21T21:29:10.610624+0000 171 periodic scrub scheduled @ 2026-06-15T21:27:58.583236+0000 14.6a6 147367 0 72236 0 441514236790 0 0 2821 3000 active+remapped+backfilling 2m 538623'255841 538644:3419931 [756,821,571,588,866,427,404,728]p756 [756,821,571,466,866,427,404,728]p756 2026-06-14T15:38:38.388825+0000 2026-05-24T17:22:25.524758+0000 184 periodic scrub scheduled @ 2026-06-15T17:10:09.062748+0000 14.7c0 146534 65322 0 0 440839397264 0 0 2686 3000 active+undersized+degraded+remapped+backfilling 115m 538644'254775 538644:3272414 [601,922,925,475,418,430,729,770]p601 [601,922,925,475,418,430,729,NONE]p601 2026-06-14T15:45:22.990803+0000 2026-05-01T17:19:03.755955+0000 181 periodic scrub scheduled @ 2026-06-15T19:19:43.063159+0000 14.7eb 147151 120155 0 0 441832373681 0 0 2769 3000 active+undersized+degraded+remapped+backfilling 29m 538630'255052 538644:2220057 [765,430,918,404,572,519,491,582]p765 [NONE,430,918,404,572,519,491,582]p430 2026-06-14T17:54:38.635319+0000 2026-04-25T00:44:04.506414+0000 194 periodic scrub scheduled @ 2026-06-16T01:03:03.900048+0000 14.7ef 147436 36508 0 0 442678024400 0 0 3122 3000 active+undersized+degraded+remapped+backfilling 86m 538623'255447 538644:3274575 [879,438,597,762,922,569,492,789]p879 [879,438,597,NONE,922,569,492,789]p879 2026-06-14T16:15:57.637802+0000 2026-05-24T22:51:06.029063+0000 184 periodic scrub scheduled @ 2026-06-16T00:24:20.042366+0000 14.81c 146784 0 83165 0 441660588723 0 0 2662 3000 active+remapped+backfilling 112m 538637'255134 538644:3196268 [585,415,432,486,548,925,923,729]p585 [585,415,432,486,548,757,923,729]p585 2026-06-14T15:13:57.723950+0000 2026-05-02T22:01:31.048183+0000 206 periodic scrub scheduled @ 2026-06-15T18:59:21.504093+0000 14.841 147126 141085 0 0 441060807666 0 0 2752 3000 active+undersized+degraded+remapped+backfilling 9m 538623'255757 538644:3514803 [457,768,496,871,805,529,788,921]p457 [457,NONE,496,871,805,529,788,921]p457 2026-06-14T17:09:01.290653+0000 2026-06-09T22:05:21.816387+0000 171 periodic scrub scheduled @ 2026-06-16T02:57:55.542466+0000 14.862 147101 0 68356 0 440733267887 0 0 2770 3000 active+remapped+backfilling 2h 538630'255934 538644:2886664 [548,530,495,487,919,590,573,411]p548 [548,530,495,487,919,590,767,411]p548 2026-06-14T16:06:00.663976+0000 2026-06-11T23:28:49.078998+0000 169 periodic scrub scheduled @ 2026-06-16T00:28:44.360006+0000 14.866 146890 0 143018 0 441288616525 0 0 2864 3000 active+remapped+backfilling 8m 538631'255569 538644:3292606 [736,542,447,816,876,527,571,587]p736 [736,542,447,816,876,527,755,587]p736 2026-06-14T16:38:03.246654+0000 2026-05-24T19:59:29.922458+0000 175 periodic scrub scheduled @ 2026-06-15T18:29:53.220581+0000 14.8c6 146738 0 102161 0 439004272729 0 0 2782 3000 active+remapped+backfilling 79m 538630'255835 538644:2388109 [566,547,918,410,458,730,428,784]p566 [566,547,918,410,458,730,428,764]p566 2026-06-14T15:43:08.753332+0000 2026-06-11T23:58:14.113576+0000 166 periodic scrub scheduled @ 2026-06-15T18:16:57.935745+0000 14.906 146698 0 9733 0 440009073164 0 0 2672 3000 active+remapped+backfilling 5h 538644'254972 538644:2647065 [733,451,546,805,440,597,575,930]p733 [733,451,546,805,762,597,575,930]p733 2026-06-14T15:25:06.325761+0000 2026-05-25T22:53:16.807314+0000 349 periodic scrub scheduled @ 2026-06-16T01:08:48.098360+0000 14.98d 147449 12286 0 0 442355923074 0 0 2720 3000 active+undersized+degraded+remapped+backfilling 2h 538644'255766 538644:3332319 [543,816,588,886,929,771,445,727]p543 [543,816,588,886,929,NONE,445,727]p543 2026-06-14T18:35:29.557337+0000 2026-05-19T22:24:55.910269+0000 177 periodic scrub scheduled @ 2026-06-15T21:16:42.388682+0000 14.9cd 146637 134642 134642 0 439401811884 0 0 2823 3000 active+undersized+degraded+remapped+backfilling 15m 538630'254967 538644:2082339 [471,564,772,589,411,875,524,539]p471 [471,564,NONE,589,411,814,524,539]p471 2026-06-14T17:26:14.657818+0000 2026-05-24T01:04:58.642636+0000 194 periodic scrub scheduled @ 2026-06-16T02:54:36.943009+0000 14.a1f 146958 0 68570 0 440750912729 0 0 2819 3000 active+remapped+backfilling 4h 538629'254543 538644:2950946 [541,734,560,482,435,810,930,451]p541 [756,734,560,544,435,810,930,451]p756 2026-06-14T15:57:25.214642+0000 2026-05-22T23:54:50.098413+0000 170 periodic scrub scheduled @ 2026-06-16T01:47:43.988689+0000 14.add 147580 0 71266 0 441996469932 0 0 2676 3000 active+remapped+backfilling 2h 538644'257306 538644:3042241 [567,554,789,800,430,407,451,876]p567 [567,554,767,800,430,407,783,876]p567 2026-06-14T17:25:19.895000+0000 2026-05-21T22:02:39.234612+0000 148 periodic scrub scheduled @ 2026-06-16T03:52:55.725573+0000 14.afa 147008 144284 0 0 441824243002 0 0 3299 3000 active+undersized+degraded+remapped+backfilling 2m 538625'255059 538644:3009551 [793,870,735,550,599,803,755,423]p793 [793,870,735,550,599,803,NONE,423]p793 2026-06-14T15:03:00.514784+0000 2026-04-28T22:16:03.752891+0000 181 queued for scrub 14.b46 147577 145234 0 0 443197541874 0 0 2756 3000 active+undersized+degraded+remapped+backfilling 3m 538623'256771 538644:3147481 [589,761,810,918,471,732,875,555]p589 [589,NONE,810,918,471,732,875,555]p589 2026-06-14T18:14:31.052796+0000 2026-06-10T23:04:43.912433+0000 140 periodic scrub scheduled @ 2026-06-15T23:28:35.957188+0000 14.b4a 147259 20791 0 0 440807686614 0 0 2803 3000 active+undersized+degraded+remapped+backfilling 112m 538644'255896 538644:3227541 [495,422,460,775,525,911,760,879]p495 [495,422,460,775,525,911,NONE,879]p495 2026-06-14T19:07:56.653681+0000 2026-06-12T19:42:27.796021+0000 221 periodic scrub scheduled @ 2026-06-16T03:36:38.565633+0000 14.b59 147578 50997 0 0 441311088585 0 0 2794 3000 active+undersized+degraded+remapped+backfilling 74m 538629'255062 538644:2906234 [450,589,515,807,924,494,753,566]p450 [450,589,515,807,924,494,NONE,566]p450 2026-06-14T18:10:56.608051+0000 2026-05-18T21:41:20.618735+0000 199 periodic scrub scheduled @ 2026-06-16T03:28:07.014105+0000 14.c81 146985 2522 0 0 440991942082 0 0 3083 3000 active+undersized+degraded+remapped+backfilling 2h 538622'256085 538644:3025906 [766,805,785,496,595,421,543,567]p766 [NONE,805,785,496,595,421,543,567]p805 2026-06-14T16:24:56.915297+0000 2026-06-08T22:08:22.454335+0000 191 periodic scrub scheduled @ 2026-06-15T17:41:07.991873+0000 14.d7d 147458 36439 72878 0 442333240856 0 0 2827 3000 active+undersized+degraded+remapped+backfilling 100m 538623'256489 538644:3581471 [480,564,788,756,807,879,521,737]p480 [480,564,788,NONE,411,879,803,737]p480 2026-06-14T17:54:55.187428+0000 2026-06-12T01:28:13.410269+0000 145 periodic scrub scheduled @ 2026-06-16T02:00:20.019147+0000 14.dbd 146790 137313 0 0 440534935791 0 0 3173 1184 active+undersized+degraded+remapped+backfilling 8m 538625'254933 538644:3360460 [870,524,495,923,757,552,574,595]p870 [870,524,495,923,NONE,552,574,595]p870 2026-06-14T16:49:44.659768+0000 2026-04-17T23:26:47.908421+0000 158 periodic scrub scheduled @ 2026-06-16T03:56:09.985612+0000 14.de1 147396 0 206662 0 442154075454 0 0 2810 3000 active+remapped+backfilling 78m 538623'256089 538644:3487712 [554,728,564,792,878,422,811,916]p554 [554,771,564,792,878,422,492,916]p554 2026-06-14T18:21:30.674695+0000 2026-04-27T21:41:28.478935+0000 156 periodic scrub scheduled @ 2026-06-16T01:09:27.945400+0000 14.e50 147903 0 131774 0 443479571512 0 0 2743 3000 active+remapped+backfilling 3h 538644'257080 538644:2706189 [751,433,925,790,584,458,496,418]p751 [751,433,925,486,584,779,496,418]p751 2026-06-14T16:01:59.784875+0000 2026-04-21T00:35:48.629345+0000 210 periodic scrub scheduled @ 2026-06-15T18:55:35.515409+0000 14.e5d 147279 0 128371 0 441101050516 0 0 2722 3000 active+remapped+backfilling 33m 538622'255202 538644:3059105 [535,595,812,539,928,729,416,866]p535 [535,595,812,764,928,729,416,866]p535 2026-06-14T17:51:24.401012+0000 2026-04-14T19:32:25.299183+0000 183 periodic deep scrub scheduled @ 2026-06-16T02:46:54.098228+0000 14.ea1 147492 0 21588 0 440976435749 0 0 3172 3000 active+remapped+backfilling 4h 538622'255687 538644:2796631 [783,581,489,514,924,544,734,436]p783 [783,581,489,408,924,544,734,436]p783 2026-06-14T16:25:15.753940+0000 2026-04-30T21:33:04.424574+0000 218 periodic scrub scheduled @ 2026-06-15T18:17:17.295739+0000 14.f4c 147064 116523 0 0 440693695259 0 0 2812 3000 active+undersized+degraded+remapped+backfilling 27m 538634'255762 538644:2287392 [444,421,789,574,471,758,915,536]p444 [444,421,789,574,471,NONE,915,536]p444 2026-06-14T16:35:45.083177+0000 2026-04-19T17:04:38.397898+0000 151 periodic scrub scheduled @ 2026-06-15T20:59:52.556270+0000 14.f6b 146935 0 269205 0 439851927771 0 0 2800 3000 active+remapped+backfilling 33m 538644'255385 538644:3489810 [768,737,927,804,528,426,586,487]p768 [768,569,927,804,528,727,580,487]p768 2026-06-14T17:26:25.227246+0000 2026-05-26T23:38:30.606626+0000 189 periodic scrub scheduled @ 2026-06-15T23:37:07.292834+0000

  • NOTE: Omap statistics are gathered during deep scrub and may be inaccurate soon afterwards depending on utilization. See http://docs.ceph.com/en/latest/dev/placement-group/#omap-statistics for further details.

root@VSTOR-CEPH-MBF9-MON-05:/# ceph pg ls-by-osd osd.751 | grep -E 'backfill|recover|undersized' 14.d9 146827 0 146827 0 439429300400 0 0 2705 3000 active+remapped+backfill_wait 9h 538644'254582 538644:2620754 [441,758,546,526,423,493,562,927]p441 [441,751,546,526,423,493,562,927]p441 2026-06-14T18:38:11.090090+0000 2026-04-09T22:14:35.687021+0000 184 periodic deep scrub scheduled @ 2026-06-15T19:54:30.535702+0000 14.470 147461 0 15591 0 443774591808 0 0 2719 3000 active+remapped+backfilling 5h 538623'256357 538644:3160131 [546,421,525,487,914,601,455,866]p546 [751,421,557,487,914,601,455,527]p751 2026-06-14T16:10:08.006352+0000 2026-06-07T19:38:13.233076+0000 189 periodic scrub scheduled @ 2026-06-16T02:01:33.253444+0000 14.9cf 147550 0 147550 0 441162080327 0 0 2854 3000 active+remapped+backfill_wait 9h 538624'256010 538644:2536287 [481,922,445,548,528,408,925,776]p481 [481,922,445,548,528,751,925,776]p481 2026-06-14T17:54:51.517403+0000 2026-04-24T17:29:25.122450+0000 207 periodic scrub scheduled @ 2026-06-16T05:23:49.047520+0000 14.a41 147041 0 294082 0 439638436024 0 0 2784 3000 active+remapped+backfill_wait 10h 538633'255868 538644:3310348 [573,875,485,286,531,810,755,596]p573 [573,875,485,286,531,751,437,596]p573 2026-06-14T17:08:46.385969+0000 2026-04-20T17:17:19.965302+0000 210 periodic scrub scheduled @ 2026-06-16T02:52:37.527155+0000 14.a57 146824 0 734120 0 439112055312 0 0 3274 3000 active+remapped+backfill_wait 9h 538637'253753 538644:3020638 [791,558,867,588,766,469,518,415]p791 [791,751,464,576,867,808,518,415]p791 2026-06-14T17:18:44.699613+0000 2026-06-09T00:25:19.829161+0000 159 periodic scrub scheduled @ 2026-06-15T22:55:10.781844+0000 14.ad6 147195 0 147195 0 441266350980 0 0 2613 3000 active+remapped+backfill_wait 9h 538623'255371 538644:2448153 [551,593,465,569,918,870,441,484]p551 [551,593,465,569,918,870,441,751]p551 2026-06-14T17:47:29.352906+0000 2026-05-27T23:09:10.327817+0000 148 periodic scrub scheduled @ 2026-06-16T03:45:59.171665+0000 14.c80 147120 0 147120 0 440173207667 0 0 2900 3000 active+remapped+backfill_wait 9h 538631'255376 538644:2807929 [446,732,537,757,583,815,415,922]p446 [446,732,537,751,583,815,415,922]p446 2026-06-14T16:30:58.282471+0000 2026-05-25T23:09:05.943839+0000 174 periodic scrub scheduled @ 2026-06-15T22:49:50.673221+0000 14.e50 147903 0 131416 0 443479571512 0 0 2743 3000 active+remapped+backfilling 3h 538644'257080 538644:2706726 [751,433,925,790,584,458,496,418]p751 [751,433,925,486,584,779,496,418]p751 2026-06-14T16:01:59.784875+0000 2026-04-21T00:35:48.629345+0000 210 periodic scrub scheduled @ 2026-06-15T18:55:35.515409+0000 14.f68 147031 0 147031 0 440525163524 0 0 2809 3000 active+remapped+backfill_wait 9h 538630'255057 538644:2471418 [495,520,573,884,918,463,444,481]p495 [495,520,573,884,751,463,444,481]p495 2026-06-14T16:19:06.148918+0000 2026-05-18T22:09:53.421387+0000 144 periodic scrub scheduled @ 2026-06-16T03:21:47.010157+0000 14.f90 146203 0 146203 0 438652500215 0 0 2833 3000 active+remapped+backfill_wait 9h 538639'255303 538644:3219181 [524,447,736,812,783,581,480,760]p524 [524,447,736,812,783,581,480,751]p524 2026-06-14T17:22:20.818073+0000 2026-06-09T20:05:54.840455+0000 187 periodic scrub scheduled @ 2026-06-15T18:01:13.060704+0000

3. Cách đọc source/target (trả lời "làm sao biết")

Quy tắc: so UP với ACTING theo từng vị trí shard. - ACTING = đang giữ = nguồn (đọc). UP = nơi muốn đến = đích (ghi). - Vị trí lệch nhau → shard đang dời: OSD trong ACTING là source, OSD trong UP là target. - NONE trong ACTING → shard mất → degraded → OSD ở UP vị trí đó là target, 6 OSD ACTING còn lại là source (6:1).

Ví dụ từ chính data của bạn:

14.68c (degraded — 751 là target/GHI):

UP    =[751,808,784,527,420,580,478,469]
ACTING=[NONE,808,784,527,420,580,478,469]

s0 mất → dựng lại lên 751 (ghi); 6 trong {808,784,527,420,580,478,469} bị đọc để tái dựng → 6:1. ✓

14.470 (misplaced — 751 là source/ĐỌC):

UP    =[546,...]  ACTING=[751,...]

s0: đích 546 nhận, 751 bị đọc → 1:1.

========

root@VSTOR-CEPH-MBF9-MON-05:/# ceph tell osd.311 dump_recovery_reservations { "local_reservations": { "max_allowed": 1, "min_priority": 0, "queues": [], "in_progress": [] }, "remote_reservations": { "max_allowed": 1, "min_priority": 0, "queues": [], "in_progress": [] } } root@VSTOR-CEPH-MBF9-MON-05:/# ceph osd pool stats pool .mgr id 1 nothing is going on

pool .rgw.root id 2 client io 1.4 MiB/s rd, 884 op/s rd, 0 op/s wr

pool MBF9-HDD-01 id 3 client io 74 MiB/s rd, 268 MiB/s wr, 1.55k op/s rd, 377 op/s wr

pool default.rgw.log id 4 client io 482 KiB/s rd, 30 KiB/s wr, 469 op/s rd, 29 op/s wr

pool default.rgw.control id 5 nothing is going on

pool default.rgw.meta id 6 client io 1.0 MiB/s rd, 1.25k op/s rd, 0 op/s wr

pool default.rgw.buckets.index id 7 client io 85 MiB/s rd, 376 KiB/s wr, 41.12k op/s rd, 504 op/s wr

pool default.rgw.buckets.non-ec id 8 client io 1.9 KiB/s rd, 9.8 KiB/s wr, 2 op/s rd, 0 op/s wr

pool fs.data id 9 client io 777 KiB/s rd, 1.1 MiB/s wr, 3 op/s rd, 32 op/s wr

pool fs.metadata id 10 client io 202 KiB/s rd, 225 KiB/s wr, 5 op/s rd, 40 op/s wr

pool .nfs id 11 client io 5.1 KiB/s rd, 5 op/s rd, 0 op/s wr

pool fs.data.ssd.01 id 13 nothing is going on

pool MBF9-HDD-02 id 14 1908606/4825483832 objects degraded (0.040%) 25046137/4825483832 objects misplaced (0.519%) recovery io 799 MiB/s, 277 objects/s client io 21 KiB/s rd, 24 KiB/s wr, 15 op/s rd, 59 op/s wr

pool default.rgw.buckets.data id 15 nothing is going on

pool MBF9-SSD-01 id 16 client io 6.8 MiB/s rd, 3.0 MiB/s wr, 158 op/s rd, 1.74k op/s wr

pool fs.data.ssd.02 id 17 nothing is going on

root@VSTOR-CEPH-MBF9-MON-05:/# ceph -s cluster: id: c85b0190-27aa-11ef-97a7-7f90cac4804a health: HEALTH_WARN Degraded data redundancy: 1907625/17985921156 objects degraded (0.011%), 18 pgs degraded, 18 pgs undersized Some pool(s) have the nodeep-scrub flag(s) set 6 slow ops, oldest one blocked for 103 sec, osd.311 has slow ops

services: mon: 5 daemons, quorum VSTOR-CEPH-MBF9-MON-05,VSTOR-CEPH-MBF9-MDS-09,VSTOR-CEPH-MBF9-MDS-08,VSTOR-CEPH-MBF9-MON-07,VSTOR-CEPH-MBF9-MON-06 (age 41h) mgr: VSTOR-CEPH-MBF9-MON-05.dptncn(active, since 10d), standbys: VSTOR-CEPH-MBF9-MON-07.blpwtk, VSTOR-CEPH-MBF9-MON-06.oleywv mds: 2/2 daemons up, 2 hot standby osd: 925 osds: 925 up (since 23h), 925 in (since 23h); 125 remapped pgs rgw: 27 daemons active (9 hosts, 1 zones)

data: volumes: 1/1 healthy pools: 16 pools, 14497 pgs objects: 2.41G objects, 3.5 PiB usage: 4.7 PiB used, 3.0 PiB / 7.7 PiB avail pgs: 1907625/17985921156 objects degraded (0.011%) 25044656/17985921156 objects misplaced (0.139%) 14369 active+clean 91 active+remapped+backfill_wait 16 active+remapped+backfilling 11 active+undersized+degraded+remapped+backfill_wait 7 active+undersized+degraded+remapped+backfilling 2 active+clean+scrubbing+deep 1 active+clean+laggy

io: client: 173 MiB/s rd, 234 MiB/s wr, 49.66k op/s rd, 2.40k op/s wr recovery: 789 MiB/s, 275 objects/s

root@VSTOR-CEPH-MBF9-MON-05:/# ceph pg ls backfilling PG OBJECTS DEGRADED MISPLACED UNFOUND BYTES OMAP_BYTES OMAP_KEYS LOG LOG_DUPS STATE SINCE VERSION REPORTED UP ACTING SCRUB_STAMP DEEP_SCRUB_STAMP LAST_SCRUB_DURATION SCRUB_SCHEDULING 14.f3 147573 0 127156 0 442636795210 0 0 3044 3000 active+remapped+backfilling 2h 539379'257152 539379:4011451 [805,920,529,925,545,758,448,781]p805 [805,761,529,925,545,481,448,781]p805 2026-06-14T15:36:24.176410+0000 2026-05-17T22:56:22.255481+0000 180 queued for scrub 14.32c 146785 0 88148 0 440113013144 0 0 2839 3000 active+remapped+backfilling 104m 539379'255652 539379:3295013 [575,800,527,413,751,584,788,737]p575 [575,800,527,413,773,584,788,737]p575 2026-06-14T18:22:36.157564+0000 2026-04-15T23:10:31.755776+0000 275 queued for deep scrub 14.3d3 147067 0 90955 0 440448677395 0 0 3255 3000 active+remapped+backfilling 96m 539376'254856 539379:2677695 [809,489,516,597,461,495,445,409]p809 [809,489,516,597,461,495,772,409]p809 2026-06-14T15:36:54.705703+0000 2026-06-12T17:52:24.845090+0000 165 queued for scrub 14.485 147517 0 113578 0 442305607981 0 0 2704 3000 active+remapped+backfilling 61m 539377'256993 539379:3218059 [483,762,548,430,797,811,917,503]p483 [483,531,548,430,797,811,917,503]p483 2026-06-14T18:45:29.409926+0000 2026-05-23T00:51:20.771939+0000 174 queued for scrub 14.4f8 147616 51035 0 0 442519205468 0 0 2728 3000 active+undersized+degraded+remapped+backfilling 96m 539379'257412 539379:2891610 [486,404,467,592,821,516,867,763]p486 [486,404,467,592,821,516,867,NONE]p486 2026-06-14T16:48:57.141611+0000 2026-04-18T19:35:07.604338+0000 191 queued for scrub 14.5e8 147039 0 103391 0 440007180528 0 0 3187 3000 active+remapped+backfilling 77m 539372'255611 539379:3313678 [780,499,423,772,526,931,574,589]p780 [780,499,423,760,526,931,574,589]p780 2026-06-14T18:31:40.094360+0000 2026-04-27T21:20:36.398076+0000 188 periodic scrub scheduled @ 2026-06-16T06:11:02.591516+0000 14.67f 147746 0 10965 0 442802442380 0 0 2746 3000 active+remapped+backfilling 4h 539376'255522 539379:3325089 [545,495,429,768,529,775,452,416]p545 [545,495,429,768,529,775,490,416]p545 2026-06-14T19:01:32.742018+0000 2026-05-21T21:39:16.124370+0000 165 queued for scrub 14.788 146844 0 208398 0 439253169688 0 0 2771 3000 active+remapped+backfilling 76m 539371'255026 539379:2458759 [420,480,736,915,794,803,598,753]p420 [420,480,736,768,794,803,598,553]p420 2026-06-14T17:12:42.681938+0000 2026-05-04T19:01:36.147930+0000 166 queued for scrub 14.8ae 147557 0 121737 0 442575743223 0 0 3098 3000 active+remapped+backfilling 45m 539369'255801 539379:3325989 [917,422,761,730,541,600,814,875]p917 [917,422,453,730,541,600,814,875]p917 2026-06-14T18:40:36.178487+0000 2026-05-24T21:52:50.772974+0000 145 queued for scrub 14.9cf 147713 0 27112 0 441403667035 0 0 2860 3000 active+remapped+backfilling 3h 539373'256216 539379:2778947 [481,922,445,548,528,408,925,776]p481 [481,922,445,548,528,751,925,776]p481 2026-06-14T17:54:51.517403+0000 2026-04-24T17:29:25.122450+0000 207 queued for scrub 14.9e0 146928 39753 0 0 439725127423 0 0 2696 3000 active+undersized+degraded+remapped+backfilling 76m 539371'255036 539379:3513293 [519,569,807,730,776,881,765,924]p519 [519,569,807,730,776,881,NONE,924]p519 2026-06-14T17:04:58.323259+0000 2026-05-04T20:12:44.511790+0000 173 queued for scrub 14.a41 147196 0 192224 0 439902160481 0 0 2775 3000 active+remapped+backfilling 116m 539376'256059 539379:3465067 [573,875,485,286,531,810,755,596]p573 [573,875,485,286,531,751,437,596]p573 2026-06-14T17:08:46.385969+0000 2026-04-20T17:17:19.965302+0000 210 queued for scrub 14.ad6 147325 0 61189 0 441488671700 0 0 2693 3000 active+remapped+backfilling 2h 539376'255551 539379:2621859 [551,593,465,569,918,870,441,484]p551 [551,593,465,569,918,870,441,751]p551 2026-06-14T17:47:29.352906+0000 2026-05-27T23:09:10.327817+0000 148 queued for scrub 14.b37 147465 0 115932 0 441600216937 0 0 2793 3000 active+remapped+backfilling 3h 539371'254993 539379:3888517 [534,453,878,404,931,537,477,757]p534 [534,765,878,404,467,537,477,431]p534 2026-06-14T17:57:05.372983+0000 2026-04-19T19:58:46.007107+0000 188 queued for scrub 14.b69 147961 46946 0 0 442108474341 0 0 3216 3000 active+undersized+degraded+remapped+backfilling 92m 539379'256403 539379:2851730 [804,919,777,413,516,459,767,567]p804 [804,919,777,413,516,459,NONE,567]p804 2026-06-14T17:11:48.685402+0000 2026-05-23T22:29:03.160435+0000 201 queued for scrub 14.b72 147739 83838 0 0 442393114289 0 0 3221 3000 active+undersized+degraded+remapped+backfilling 49m 539376'256808 539379:3336564 [876,496,545,594,910,766,533,477]p876 [876,496,545,594,910,NONE,533,477]p876 2026-06-14T16:21:17.082794+0000 2026-06-10T23:22:24.801240+0000 185 queued for scrub 14.bab 147226 0 10264 0 440266673790 0 0 2663 3000 active+remapped+backfilling 4h 539377'255799 539379:2233576 [416,796,426,762,571,910,453,590]p416 [416,796,426,762,571,477,453,590]p416 2026-06-14T18:14:05.566250+0000 2026-06-10T20:24:04.728775+0000 141 queued for scrub 14.bda 147226 110256 0 0 441042072945 0 0 2764 3000 active+undersized+degraded+remapped+backfilling 31m 539377'255844 539379:2996986 [760,538,658,568,535,467,877,470]p760 [NONE,538,658,568,535,467,877,470]p538 2026-06-14T16:04:03.320420+0000 2026-04-18T17:14:47.534133+0000 197 queued for scrub 14.c49 147121 34082 0 0 441162264553 0 0 2716 3000 active+undersized+degraded+remapped+backfilling 76m 539379'255729 539379:2978871 [485,817,776,528,917,583,564,759]p485 [485,817,776,528,917,583,564,NONE]p485 2026-06-14T16:37:59.811356+0000 2026-04-26T20:53:20.401706+0000 178 queued for scrub 14.d7f 147243 0 56238 0 441778004829 0 0 2840 3000 active+remapped+backfilling 3h 539376'255853 539379:3129812 [455,817,410,521,539,928,442,497]p455 [455,817,410,521,539,928,755,497]p455 2026-06-14T18:21:35.241150+0000 2026-05-27T17:26:08.452985+0000 203 queued for scrub 14.e55 147486 0 123298 0 441340114910 0 0 2776 3000 active+remapped+backfilling 2h 539376'256874 539379:2787973 [601,416,428,804,786,482,515,770]p601 [601,416,770,804,786,482,515,435]p601 2026-06-14T17:31:31.278905+0000 2026-06-08T19:12:09.847685+0000 143 queued for scrub 14.f9d 146642 0 125860 0 440692138489 0 0 2869 3000 active+remapped+backfilling 2h 539376'255014 539379:3318665 [590,801,476,781,916,493,768,573]p590 [590,801,765,781,916,493,473,573]p590 2026-06-14T18:49:01.204605+0000 2026-05-19T19:41:35.704482+0000 137 queued for scrub 14.fab 148149 4479 4479 0 444293620905 0 0 2788 3000 active+undersized+degraded+remapped+backfilling 106m 539376'256703 539379:2908185 [436,550,408,449,764,487,592,516]p436 [436,550,408,449,NONE,487,866,516]p436 2026-06-14T18:54:44.309591+0000 2026-05-05T22:27:10.985999+0000 170 queued for scrub

  • NOTE: Omap statistics are gathered during deep scrub and may be inaccurate soon afterwards depending on utilization. See http://docs.ceph.com/en/latest/dev/placement-group/#omap-statistics for further details.

root@VSTOR-CEPH-MBF9-MON-05:/# ceph pg ls-by-osd osd.311 | grep -E 'backfill|recover|undersized' root@VSTOR-CEPH-MBF9-MON-05:/# ceph -s cluster: id: c85b0190-27aa-11ef-97a7-7f90cac4804a health: HEALTH_WARN Degraded data redundancy: 1898704/17986037513 objects degraded (0.011%), 18 pgs degraded, 18 pgs undersized Some pool(s) have the nodeep-scrub flag(s) set

services: mon: 5 daemons, quorum VSTOR-CEPH-MBF9-MON-05,VSTOR-CEPH-MBF9-MDS-09,VSTOR-CEPH-MBF9-MDS-08,VSTOR-CEPH-MBF9-MON-07,VSTOR-CEPH-MBF9-MON-06 (age 41h) mgr: VSTOR-CEPH-MBF9-MON-05.dptncn(active, since 10d), standbys: VSTOR-CEPH-MBF9-MON-07.blpwtk, VSTOR-CEPH-MBF9-MON-06.oleywv mds: 2/2 daemons up, 2 hot standby osd: 925 osds: 925 up (since 23h), 925 in (since 23h); 125 remapped pgs rgw: 27 daemons active (9 hosts, 1 zones)

data: volumes: 1/1 healthy pools: 16 pools, 14497 pgs objects: 2.41G objects, 3.5 PiB usage: 4.7 PiB used, 3.0 PiB / 7.7 PiB avail pgs: 1898704/17986037513 objects degraded (0.011%) 25031105/17986037513 objects misplaced (0.139%) 14370 active+clean 91 active+remapped+backfill_wait 16 active+remapped+backfilling 11 active+undersized+degraded+remapped+backfill_wait 7 active+undersized+degraded+remapped+backfilling 2 active+clean+scrubbing+deep

io: client: 241 MiB/s rd, 238 MiB/s wr, 75.85k op/s rd, 4.54k op/s wr recovery: 916 MiB/s, 321 objects/s