TrueNAS Performansı ve Bakımı: IOPS, ARC, Scrub ve Disk Sağlığı
Darboğazı istemci, ağ ve disk yolunda ölçün; cache, scrub, resilver ve güncellemeleri veri güvenliğiyle birlikte yönetin.
İçerik güncellemesi:
Mimari ve çalışma modeli
Performans değerlendirmesi iş yükü tanımıyla başlar: blok boyutu, okuma/yazma oranı, rastgele/sıralı erişim, sync yazma, eşzamanlı istemci ve kabul edilen gecikme. MB/s tek başına kullanıcı deneyimi veya VM datastore başarısını anlatmaz. p95/p99 gecikme ile queue ve CPU yükünü birlikte izleyin; ortalama, kısa gecikme sıçramalarını gizleyebilir. Testi örnek veri üzerinde yapın ve üretim I/O’sunu bozabilecek benchmark’ları değişiklik penceresine alın.
ARC RAM tabanlı cache, L2ARC ek okuma cache’i, SLOG ise synchronous write intent log için ayrı aygıttır. SLOG bütün yazmaları hızlandıran genel cache değildir ve L2ARC yetersiz RAM’in otomatik ilacı değildir. Cache eklemeden önce hit ratio, çalışma seti ve CPU/disk/ağ sınırını ölçün. Sync güvenliğini kapatarak benchmark kazanmak, uygulamanın kalıcılık beklentisini ihlal edebilir.
Disk tarafında latency, kuyruk derinliği, checksum hataları, sıcaklık ve aygıt sağlığı birlikte yorumlanır. Kablo/backplane arızası disk arızasına benzeyebilir; sayaçları sıfırlamadan önce zaman, seri numarası ve olay kaydı alın. Scrub tahsis edilmiş veriyi okuyup checksum doğrular ve uygun sağlıklı yedekli kopya varsa onarabilir. Sağlık sayaçlarının temiz olması veri kurtarılabilirliğini tek başına kanıtlamaz.
Resilver arızalı/yenilenen aygıtın verisini topolojiye göre yeniden oluşturur; scrub ile aynı bakım görevi değildir. Büyük disk ve yoğun workload işlem süresini uzatabilir. Scrub, resilver, backup ve antivirüs taramasını aynı yoğun saate yığmayın. Disk değişimini yuva/seri numarasıyla teyit edin; yanlış sağlıklı diski çıkarmak arıza toleransını aşabilir. İşlem sonrasında pool durumu ve yeni uyarı teslimi kontrol edilmelidir.
Ağda hatalı paket, drop, MTU uyumsuzluğu, TCP yeniden iletim ve istemci limitlerini ölçün. LACP tek TCP akışını otomatik olarak port toplam hızına çıkarmaz; multipath/SMB multichannel farklı mekanizmalardır ve istemci/sürüm/ağ desteğiyle test edilir. Jumbo frame’i uçtan uca doğrulamadan açmayın. 10 GbE etiketi, disk veya istemci yavaşken 10 Gb/s dosya transferi garantisi değildir.
İşletim planı günlük uyarı takibi, kapasite eğilimi, başarısız koruma görevleri, disk sağlığı ve periyodik restore doğrulamasını kapsar. Güncellemede konfigürasyon yedeği, sürüm notları, driver/API değişiklikleri, bağımlı istemciler ve bakım penceresi kayıtlı olmalıdır. Değişiklik sonrası aynı kabul iş yükünü tekrar çalıştırın; yalnız sistemin açılması bakım kabulü değildir.
- 1İş yükü ve baseline
- 2Uçtan uca ölçüm
- 3Kontrollü değişiklik
- 4Kabul ve izleme
Tasarım parametreleri
- Gecikme dağılımı
- Ortalama yanında p95/p99 ve iş yükü desenini ölçün.
- Cache rolü
- ARC, L2ARC ve SLOG’u ayrı ihtiyaca göre değerlendirin.
- Veri sağlığı
- Scrub, resilver, checksum ve disk olaylarını birlikte izleyin.
- Bakım çakışması
- Yoğun görevleri iş yükünün kesinti toleransına göre planlayın.
Hesap ve uygulama örneği
Örnek sistemde normal p95 latency 8 ms iken backup ve scrub birlikte çalışınca 80 ms ölçüldüğünü varsayalım. Aynı istemci ve veriyle önce görev çakışması kaldırılır, sonra disk queue, ağ drop ve CPU kontrol edilir. L2ARC satın almak ancak ölçülen darboğaz cache ihtiyacını gösteriyorsa değerlendirilir; değerler örnektir.
10 Gb/s bağlantının teorik üst sınırı 1,25 GB/s’tir; protokol, CPU, disk ve istemci etkisi gerçek değeri düşürür. Örnek 500 GB restore 250 MB/s sürekli hızla salt veri aktarımında yaklaşık 2.000 saniye sürer; başlatma, doğrulama ve kullanıcı kabulü RTO’ya eklenir. Tek büyük dosya hızı küçük dosya kurtarmasını temsil etmeyebilir.
Hata teşhisi
| Belirti | Olası neden / ayrım | Doğrulama |
|---|---|---|
| Kopyalama hızlı, uygulama yavaş | Küçük I/O veya sync latency farklı olabilir. | Gerçek uygulama deseninde p95/p99 ölçün. |
| Checksum hataları artıyor | Disk, kablo veya backplane sorunu olabilir. | Olayları seri numarası ve yol üzerinden inceleyin. |
| Cache eklendi, fark yok | Darboğaz ağ, CPU veya yazma yolu olabilir. | Hit ratio ve uçtan uca metriklerle yatırımı doğrulayın. |
Kabul ve doğrulama kontrolleri
- Ölçümü aynı iş yükü ve kabul ölçütüyle karşılaştırın.
- IOPS, throughput ve latency’yi birlikte ölçün.
- Cache türlerini farklı rollerle değerlendirin.
- Scrub/resilver ve backup çakışmasını yönetin.
- Disk değişimini seri numarasıyla doğrulayın.
- Bakım sonrası restore ve uyarı teslimini sınayın.
İlgili kavramlar
Gecikme dağılımı
Gecikme, bir işlemin başlangıcı ile yanıtı arasındaki süredir. Ortalama değer, az sayıdaki çok yavaş işlemi gizleyebilir; medyan ile p95/p99 gibi yüzdelikler farklı sorulara cevap verir. Ağ RTT, disk bekleme, işlemci sırası ve uygulama işlemesi toplam süreye katkıda bulunur. Ölçümün istemci tarafında mı sunucuda mı yapıldığını yazın. Gecikme artışının trafik yükselmesine, bakım işine veya kapasite sınırına denk gelip gelmediğini karşılaştırın. Bir eşik seçmeden önce normal yük ve yoğun saat için temel davranışı kaydedin.
IOPS ve blok boyutu
IOPS saniyedeki I/O işlem sayısını, MB/s ise taşınan veri miktarını anlatır. Aynı IOPS sayısı farklı blok boyutlarında çok farklı bant genişliği üretir. Örneğin 10.000 işlem/s × 4 KiB yaklaşık 39,1 MiB/s eder. Okuma/yazma oranı, rastgele veya sıralı erişim ve veri koruma mekanizması sonucu değiştirir. Bir benchmark sonucunu üretim uygulamasına doğrudan taşımak yerine gerçek blok dağılımını ve eşzamanlılığı ölçün. Diskin yüksek IOPS göstermesi, uygulama yanıtının iyi olduğu anlamına gelmez; gecikme de birlikte incelenmelidir.
Bant genişliği ve gerçek aktarım
Hat kapasitesi ile uygulamanın taşıdığı yararlı veri miktarı farklıdır. Protokol başlıkları, şifreleme, yeniden iletim, küçük dosyalar ve disk beklemeleri net hızı azaltır. Bit ile byte birimini karıştırmayın: 1 Gbit/s teorik olarak 125 MB/s seviyesindedir; bu bir uygulama performans garantisi değildir. Aktarım süresini veri miktarı / ölçülen net hız şeklinde hesaplayın. Ölçümü aynı anda ağ, kaynak okuması ve hedef yazması üzerinden yaparak sınırlayıcı bileşeni bulun. Ortalama hız kadar kısa süreli düşüşleri ve diğer işlerin rekabetini de değerlendirin.
Kuyruk ve eşzamanlılık
Kuyruk, bir kaynağın işleyebildiğinden daha hızlı gelen işleri tutar. Eşzamanlılığı artırmak belirli bir noktaya kadar kapasite kullanımını yükseltir; sonra bekleme süresini büyütür. Durağan durumda Little yasası L = λ × W ilişkisidir: ortalama sistemdeki iş sayısı, tamamlanan iş hızı ile ortalama toplam sürenin çarpımıdır. Birimler tutarlı olmalıdır. 2.000 işlem/s ve 5 ms toplam süre yaklaşık 10 eşzamanlı iş demektir. Bu ilişki tasarım tahminidir; kuyruk sınırları, ani yük ve çok değişken servis süreleri ayrıca ölçülmelidir.
Kalıcılaştırma ve güç kaybı
Commit edilmiş verinin güç kaybından sonra korunması veritabanı, işletim sistemi, dosya sistemi, kontrolcü ve diskin yazma garantilerinin birleşimine bağlıdır. Yazma önbelleği ve flush davranışını bilmeden performans için güvenlik ayarlarını kapatmayın. Güç kaybı korumalı depolama faydalıdır fakat bütün zincirin doğru yapılandırıldığını tek başına kanıtlamaz. Üretim yerine kontrollü laboratuvarda arıza ve recovery testi yapın. Veri bütünlüğünü örnek dosya açılmasıyla değil, uygulama kayıtları ve desteklenen tutarlılık kontrolleriyle doğrulayın.
Yazma dayanımı ve aşınma
SSD seçimi yalnız kapasite ve ilk gün hızına göre yapılmamalıdır. TBW, DWPD, garanti süresi, güç kaybı koruması ve iş yükünün yazma davranışı birlikte değerlendirilir. DWPD hesaplarında üreticinin tanımladığı kapasite ve garanti koşulları esas alınır. Veritabanı logları, küçük rastgele yazmalar ve geçici iş dosyaları aşınmayı farklı etkiler. SMART veya üretici sağlık verisini izleyin; sıcaklık, medya hatası ve kalan dayanım sinyallerini birlikte yorumlayın. Yazma amplifikasyonu nedeniyle uygulamanın yazdığı veri miktarı, NAND üzerindeki yazma miktarıyla aynı olmayabilir.
Birincil teknik dokümantasyon
Hazırlama yöntemi
Doz Teknoloji Teknik Ekibi tarafından hazırlanan bu rehberde üreticilerin resmi dokümanları temel alınır. Örnek senaryolar ve hesaplar yöntemi açıklamak içindir; tamamlanmış müşteri testleri değildir. Uygulamadan önce sürüm, lisans, istemci desteği, güvenlik koşulları ve geri dönüş planını kendi ortamınızda doğrulayın. Seçim mevcut ürünlerinize ve iş yükünüze göre yapılır.
İlgili depolama rehberleri
TrueNAS Kurulumu: Donanım, Sürüm ve Güvenli Geçiş
Depolama rolünü, donanım uyumluluğunu, yönetim erişimini ve sürüm geçişini veri kurtarma planıyla birlikte tasarlayın.
Rehberi inceleTrueNAS ve ZFS: Pool, Vdev, RAIDZ ve Dataset Tasarımı
Kapasiteyi disk toplamından ayırın; mirror/RAIDZ topolojisini, dataset sınırlarını, snapshot büyümesini ve genişleme planını birlikte hesaplayın.
Rehberi inceleTrueNAS Dosya ve Storage Sunucusu: SMB, NFS, iSCSI ve ACL
Dosya ve blok erişimini ayırın; kullanıcı kimliği, grup yetkisi, paylaşım politikası ve istemci testleriyle güvenli erişim tasarlayın.
Rehberi inceleTrueNAS: Snapshot, Replikasyon ve Yedekten Geri Dönüş
ZFS snapshot, yerel/uzak replikasyon ve bağımsız yedeği ayrı koruma katmanları olarak tasarlayın; RPO/RTO’yu restore testiyle ölçün.
Rehberi inceleTrueNAS, OpenMediaVault, XigmaNAS ve Unraid Karşılaştırması
NAS seçeneklerini veri modeli, disk topolojisi, donanım uyumu, yedekleme, işletim ve toplam maliyet üzerinden karşılaştırın.
Rehberi inceleBilgi Merkezi’ndeki tüm rehberler
Platform seçimini mevcut ürünleriniz, iş yükünüz ve işletim ihtiyaçlarınızla birlikte değerlendiriyoruz.