システム管理者:XRISS DDR4 32GB 2666MHz RDIMM ECCは,DDR4登録ECCサーバーメモリエコシステムのためのドロップイン交換および拡張モジュールである.企業展開に推奨する検証と監視手順は以下のとおりです.
このRDIMMは,完全な72ビットECC (64データ+8ECC) を備えたx4組織化されたDRAMICを使用する.登録バッファは,スロット毎の電気負荷を約18負荷 (UDIMM) から2負荷に削減する.全メモリチャンネルが充填された状態で全速で動作する各モジュールは,出荷前に,連続ECCエラーインジェクション試験で,55°Cで72時間の燃焼を通過します.DRAM ICだけでなく,レジスタチップと関連する信号経路も,持続的なデータセンター熱条件下で信頼性があることを確保する.
VMware vSphere クラスタでは,このモジュールは vSAN オールフラッシュ構成で検証されており,メモリエラーが vSAN キャッシング層を損なう可能性があります.ECC 保護は ARC キャッシュのチェックサム計算が検証可能で正しいことを保証します巨大なバッファプールを持つ PostgreSQL または MySQL を実行する裸の金属データベースサーバーでは,ECCは,バッファプール内の単位ビットのエラーが次のチェックポイント中にディスクに伝播するサイレントデータ腐敗シナリオを防ぐ..
Q1. 稼働しているLinuxサーバーで ECCエラー率を監視し,ダウンタイムを引き起こす前にメモリ問題を検出するにはどうすればよいですか?
A: すべての主要な Linux ディストリビューションのリポジトリで利用可能な rasdaemon (RAS - 信頼性,可用性,サービス可能性 デーモン) をインストールして設定します.実行すると,`ras-mc-ctl --summary`は,DIMMごとに修正可能なエラー数と修正できないエラー数を表示します.月1回 修正可能なエラーが 標準で 予期せざるを得ません増加傾向は,1つのエラー/月から1つのエラー/週,または1つのエラー/日から増加傾向は,劣化しているDRAMセルを示し,モジュールは積極的に交換されるべきです.ほとんどのサーバーBMC (iDRAC,iLO,XClarity) はメモリエラーも追跡し,修正可能なエラー率が設定可能な限界を超えるとSNMPトラップまたは電子メールアラートを送信するように設定できます.VMware ESXi については, vCenterのハードウェア状態モニタリングは,CIMプロバイダーを通じて同等の機能を提供します.
Q2.このRDIMMは,ECCをサポートする消費者デスクトップマザーボード (ASRockやASUSのボードなど) で使用できますか?
A: いいえ. RDIMM (登録DIMM) は,消費者のデスクトップマザーボードと電気的に互換性がない.モジュールの登録バッファチップは,メモリコントローラとBIOSから特別なサポートを必要とするサーバおよびワークステーションプラットフォーム (Intel Xeon E5/E7/Scalable,AMD EPYC,C256チップセット搭載のIntel Xeon E-2300シリーズ) にのみ利用可能である.ECCサポートを宣伝する消費者用マザーボード (通常はRyzen非APUプロセッサのAM4/AM5) にはECCUDIMM (ECCの無バッファリングDIMM) が必要です.このプラットフォームの正しいモジュールです. UDIMM スロットに RDIMM をインストールすると,POST 状態がなく,損傷はありません.しかし,システムは単に起動しません..
Q3. サーバーメモリのためのx4とx8 DRAMの組織との違いは何ですか?なぜ重要ですか?
A: x4 組織は,DRAM チップがデータワードに 4 ビットずつ貢献することを意味し, 72 ビット ECC ワード (64 データ + 8 ECC) に対して 18 チップが必要です. x8 組織は,チップごとに 8 ビットを使用し, 9 チップのみが必要です.x4 組織は,優れたチップ障害耐性を提供しているため,エンタープライズサーバーメモリの標準です: 1 つの x4 チップが完全に故障した場合, 4 つのデータビットのみが影響を受け, ECC エンジンは理論的にはこれを修正することができます ('chipkill'またはSDDC機能). 1 つの x8 チップが故障した場合, 8 ビットが影響を受けます.8ビットECCの修正能力を超えて,修正できないエラーを生むこのモジュールは,x4組織化されたDRAMICを使用しており,シングルチップの故障耐性が要求されるミッションクリティカルサーバー展開に適しています.
Q4. サーバーは3年間,ECCのエラーが1つもなかった.これはECCが実際に何もしていないことを意味しますか?
A:No ということです.これは ECC が完璧に動作し,DRAM のエラー率は統計的なものです.256GBのDDR4を搭載した海面システム 約0.5-2 修正可能なエラーが平均で1日あたりあります. 報告されたエラーが表示されていないという事実は,以下のようなことを意味するかもしれません.(1) モニタリングは修正可能なエラーを報告するように設定されていません (rasdaemonの設定を確認)(2) サーバーは低背景放射線環境 (地下データセンター,鉛付きの囲み) にあります (3) DRAMの特定のバッチは平均より優れたエラー特性を持っていますまたは (4) 誤りは,特定のモニタリング設定の報告基準を下回るだけです.報告されたエラーがないことは,ECCが不要であることを証明するものではなく,システムが正常に機能していることを証明するものです.ECCが検出する修正できないエラー (データベースやファイルシステムをダウンさせるかもしれない沈黙データ腐敗を防ぐ) を初めて見るのは,ECCの値が実感的に明らかになるときです.
Q5. このモジュールをDell認定メモリを使用しているDell PowerEdgeサーバーのメモリを拡張するために使用できますか?
A: はい,XRISS RDIMM と Dell 認証されたメモリを混ぜることはサポートされていますが,最適なパフォーマンスを確保するには,バランスされた構成のためのサーバーの集団ガイドラインに従うことをお勧めします.主要な考慮事項(1) スピードをマッチします. 既存のメモリが2666MHzなら,このモジュールは2666MHzで動作します. 既存のモジュールは2400MHzなら,すべてのモジュールは2400MHzで動作します.(2) ランク組織 (単位のランク対記憶の交差が影響するので,可能な限り,二次ランク(3) Dell PowerEdge サーバーは,ライフサイクルコントローラログに非重要な"Dell 認証されていないメモリ検出"イベントを記録することがあります.これは情報のみであり,動作や保証に影響しません.デルの保証ポリシーでは デルの認証されたメモリの使用は必要ありません