Info2softは、ウェブサイトでより快適で適切な閲覧体験を提供するためにCookieを使用しています。 プライバシーポリシー
Loading...
大半のVMware環境は一見安定していますが、突然障害が発生するケースが少なくありません。ホストが応答しなくなる、データストアの容量が枯渇する、仮想マシンのパフォーマンスが数日間緩やかに低下してから初めて異常に気付くといった状況が起こり得ます。
適切なVMware監視を導入すれば、これらの問題が重大なインシデントに発展する前に検知可能です。本ガイドでは監視すべき主要指標、実用的な監視フローの構築手順、2026年時点でvSphere環境に最適なツールを解説します。
VMware監視とは、ESXiホスト、vCenter Server、業務アプリケーションを実行する仮想マシンの状態を継続的に追跡するプロセスを指します。
共有型仮想化環境では障害が局所的に収まらない特徴があります。単一の過負荷VMがホスト全体のパフォーマンス低下を引き起こしたり、容量不足のデータストアが複数の業務システムを一斉に停止させたりするため、監視によって問題が拡大する前に把握する可視性が不可欠です。
ブロードコムによる買収以降、企業の負担はさらに大きくなっています。多くの組織でライセンス費用の高騰やリソース利用効率化の圧力が強まっている状況です。
これらの背景からVMware監視の重要性はこれまで以上に高まっています。単なる運用ベストプラクティスに留まらず、VMware環境全体のパフォーマンス、可用性、コスト効率を維持する上での核心的施策と言えます。
堅牢な監視基盤を構築するには多層的な戦略が必要です。単一の指標だけでは分散システムの健全性を完全に把握できないため、ハイパーバイザー層のデータと各VM内部の状況を組み合わせて確認する必要があります。
出発点としてはvSphereクライアントのパフォーマンスグラフが最適で、追加ソフトウェアは不要です。任意のVMまたはホストを選択し、監視>パフォーマンス>詳細に移動するとリアルタイムおよび過去の履歴データを参照できます。
最大3種類の指標を同時に比較表示可能で、積層表示と重ね合わせ表示を切り替えられます。CPUスパイクとストレージレイテンシの相関関係を確認する際に便利です。
VMware APIはハイパーバイザー層の状況を詳細に取得できますが、VM内部の情報までは把握できません。全体像を把握するため、ハイパーバイザー指標とゲストOSのデータを併用します。
WindowsサーバーにはWMI、LinuxホストにはSNMPまたはSSHを使用し、ハイパーバイザー側の報告値とゲストOS内のアプリ実際の動作状況を比較検証します。
固定の閾値は誤った判断を引き起こす恐れがあります。バックアップ実行中のSQLサーバーではCPU使用率90%が正常でも、Webゲートウェイでは異常アラートとなるためです。
可能な場合はAI・機械学習機能搭載ツールを活用し、各業務システムの「正常な状態」を学習させます。これにより誤アラートを削減し、対応が必要な通知のみを抽出可能です。
基準値を作成後、頻出するパフォーマンス異常に対しアラートを設定します。多くの管理者がまず以下の閾値を導入しています。
複数のツールやタブを切り替えて確認する手間を省きます。ホスト、VM、データストアの情報を集約した単一のダッシュボードがあれば、個別VMの画面では発見できないクラスタ全体の傾向(クラスタ全体でレイテンシが上昇するなど)を容易に把握できます。
VDI業務を運用している場合は、ダッシュボードにVMware Horizon監視セクションを追加します。セッション接続成功率とホスト健全性を並べて追跡することで、ネットワーク障害とサーバー側の問題を速やかに切り分けられます。
本番環境の障害に対し手動対応では対応速度が追いつきません。成熟した監視環境の最終工程は、アラートを自動アクションと連携させることです。ITSMプラットフォームへチケットを起票する、PowerCLIスクリプトを実行しストレージ追加またはvMotionで負荷の高いVMを移行するといった処理を自動化します。
安定したvSphere環境を運用するには、単にホストの稼働状況を確認するだけでは不十分です。優秀な運用チームは、ハイパーバイザーが共有リソースをどれだけ効率的に管理できているかを示す特定指標を追跡しています。
仮想化環境のCPUパフォーマンスは使用率の数値だけでは判断できません。より重要な判断基準は、VMが処理実行を必要とするタイミングでスケジューリングされているかどうかです。
vSphereは未使用VMからRAMを回収する複数の仕組みを搭載しているため、物理サーバーよりメモリ監視の判断が複雑になります。
ストレージは仮想化環境で最も頻出するパフォーマンスボトルネックの一つであり、スループットと待機時間の両方を監視する必要があります。
仮想ネットワークのトラフィックは大半が物理ホスト外部に流出しないため、トラブルシュートが難しい傾向にあります。
クラスタ層では、リソースの分散状況や耐障害機能が正常に動作しているか把握する必要があります。
早見表:指標閾値一覧
以下の閾値は汎用的な基準として広く活用されていますが、適切な数値は業務システムやストレージ種別によって変動します。
| 指標 | 警告閾値 | 重大閾値 |
|---|---|---|
| CPUレディ時間 | 3% | 5% |
| ストレージレイテンシ(GAVG) | 20 ms | 30 ms |
| データストア使用率 | 80% | 90% |
| メモリスワップ速度 | 0 Kbps超 | 500 Kbps超 |
| ネットワークパケット損失率 | 1% | 5% |
最適な監視ツールは運用チームの規模、技術知識、予算によって異なります。標準搭載のvSphereツールだけで必要な機能を充足できる組織もあれば、ESXiホストまたはハイブリッドクラウド環境の詳細な可視化を実現するためサードパーティ製プラットフォームを導入する組織も存在します。
大半の管理者はvSphereライセンスに含まれる標準ツールから運用を開始します。
サードパーティ製ツールはVMware以外の基盤(物理ストレージアレイ、パブリッククラウドプラットフォームなど)との連携範囲が広く、柔軟なダッシュボードやアラート設定機能を提供する製品が多い特徴があります。
| ツール名 | 推奨環境 | 主な特長 |
|---|---|---|
| PRTG | 中規模企業運用チーム | 統合ダッシュボード上でCPU、メモリ、データストア容量を一括監視 |
| Datadog | ハイブリッドクラウド環境 | オンプレミスとクラウドのVMware指標をリアルタイムダッシュボードに集約 |
| SolarWinds VMAN | 容量計画業務 | VMリソース適正化提案、シナリオ別容量シミュレーション機能搭載 |
| ManageEngine OpManager | 自動化・コンプライアンス監査 | パフォーマンス監視、容量計画、コンプライアンス監査を一体化 |
| Netdata | オープンソース・詳細指標取得 | ESXiホスト、VM、データストア、仮想インターフェースの指標を1秒単位で収集 |
| Veeam ONE | バックアップと監視の両方を運用 | リアルタイムパフォーマンスアラートとバックアップジョブの健全性確認を連携 |
選定基準
適切なツールを判断する主な3要素は以下の通りです。
高性能なツールを導入しても、監視方針の設定・保守が適切でなければ早期障害検知は実現できず、障害発生後に原因調査に時間を費やすことになります。
顕著なパフォーマンススパイクが60秒以内に発生・収束するケースも存在します。監視ツールのデータ取得間隔が5分に設定されていると、この事象が履歴に残らず、ユーザーからの遅延報告に対し原因を特定できなくなります。
最新の監視ツールは30秒間隔でのデータ収集に対応しています。導入予定のツールがこの機能を搭載していない場合、本番vSphere環境の要求に対応可能か再検討してください。
ツール標準のアラート閾値は、固有の業務システムに適合しない場合が大半です。ドメインコントローラーと動画レンダリングサーバーでは正常時のCPU負荷パターンが大きく異なります。
カスタム閾値を設定する前に各業務システムを最低2週間観測します。これにより誤アラートを削減し、汎用的な既定値ではなく実際のアプリ動作に基づいた通知を設定できます。
すべての異常に即時対応する必要はないため、2段階の通知区分を導入し運用チームの対応優先度を明確化します。
稼働中だが長期間使用されていないVMはCPU、メモリ、ストレージを消費し続け、サブスクリプション型ライセンスの場合は費用増加の要因にもなります。
vCenterのインベントリを定期的に確認し、30日間CPU使用率がほぼ0かつディスクI/Oが発生していないVMを洗出します。不要な業務システムを廃止することでリソースを解放し、ライセンス利用量の削減も実現可能です。
一部のサードパーティ監視ツールはソケット数またはVM台数に応じて課金されます。環境の拡張・統合を実施する際、監視費用が基盤の成長速度を上回らないよう管理してください。
ブロードコムが随時実施するライセンス改定が、VMware製品群および上層のサードパーティツールにどのような影響を与えるか定期的に確認します。
監視は異常発生を通知するだけで、消失したデータを復旧する機能は持っていません。
多くのITチームは可視化ツールに多額の投資をする一方、バックアップを後回しにしがちです。これは重大な運用リスクとなります。VMware環境に適切なバックアップ方針を構築するには、本番環境にいかなる障害が発生しても復元可能な独立したデータ複製を作成する必要があります。
この課題を解決するため専用バックアップソリューションが不可欠です。i2Backupはエンタープライズ向けバックアッププラットフォームで、VMware環境に加え物理サーバー、データベース、非構造化データを単一管理コンソールから一括保護可能です。
バックアップ以上の機能を必要とするチーム向けに、Info2softはi2Availabilityも提供しています。VMwareその他の仮想化環境向けにリアルタイムレプリケーションと自動フェイルオーバーを実装し、本番障害発生時のRPOとRTOを最小限に抑えます。
監視とバックアップは組み合わせて活用することで最大の効果を発揮します。監視は異常の早期通知、バックアップは確実な復旧手段を提供し、二つが連携することで耐障害性の高いVMware環境の基盤を形成します。
効果的なVMware監視は一度設定すれば完了する作業ではなく、環境の成長に合わせ継続的に見直す運用施策です。適切な指標、ツール、環境に適応した方針の3要素が不可欠です。
まず基礎から着手しましょう。ESXiホストとVM全体のCPUレディ時間、メモリ負荷、ストレージレイテンシ、ネットワーク健全性を追跡します。閾値設定前に基準値を作成し、アラート階層を分けて不要な通知を削減、定期的にコストを隠れて増加させるリソース浪費VMを監査します。
環境規模の拡大またはライセンス条件の変更に伴い、利用するツールを再検討してください。10台規模のクラスタに適したツールが、ハイブリッドクラウド拡張を伴う複数拠点構成では機能不足になるケースがあります。
最後に忘れてはならない点として、監視は異常を知らせるだけで、失われたデータを復旧することはできません。Info2softのi2Backupのような信頼性の高いバックアップソリューションと堅牢な監視方針を併用することで、可視性と復旧可能性が単独ではなく連携して機能する環境を構築できます。