Loading...

We've detected that your browser language is Chinese. Would you like to visit our Chinese website? [ Dismiss ]
By: Emma

大半のVMware環境は一見安定していますが、突然障害が発生するケースが少なくありません。ホストが応答しなくなる、データストアの容量が枯渇する、仮想マシンのパフォーマンスが数日間緩やかに低下してから初めて異常に気付くといった状況が起こり得ます。

適切なVMware監視を導入すれば、これらの問題が重大なインシデントに発展する前に検知可能です。本ガイドでは監視すべき主要指標、実用的な監視フローの構築手順、2026年時点でvSphere環境に最適なツールを解説します。

VMware監視とは何か、その重要性

VMware監視とは、ESXiホスト、vCenter Server、業務アプリケーションを実行する仮想マシンの状態を継続的に追跡するプロセスを指します。

共有型仮想化環境では障害が局所的に収まらない特徴があります。単一の過負荷VMがホスト全体のパフォーマンス低下を引き起こしたり、容量不足のデータストアが複数の業務システムを一斉に停止させたりするため、監視によって問題が拡大する前に把握する可視性が不可欠です。

ブロードコムによる買収以降、企業の負担はさらに大きくなっています。多くの組織でライセンス費用の高騰やリソース利用効率化の圧力が強まっている状況です。

これらの背景からVMware監視の重要性はこれまで以上に高まっています。単なる運用ベストプラクティスに留まらず、VMware環境全体のパフォーマンス、可用性、コスト効率を維持する上での核心的施策と言えます。

VMware監視とは

 

VMwareの監視手法:段階的アプローチ

堅牢な監視基盤を構築するには多層的な戦略が必要です。単一の指標だけでは分散システムの健全性を完全に把握できないため、ハイパーバイザー層のデータと各VM内部の状況を組み合わせて確認する必要があります。

1. 標準搭載ツールから活用

出発点としてはvSphereクライアントのパフォーマンスグラフが最適で、追加ソフトウェアは不要です。任意のVMまたはホストを選択し、監視>パフォーマンス>詳細に移動するとリアルタイムおよび過去の履歴データを参照できます。

最大3種類の指標を同時に比較表示可能で、積層表示と重ね合わせ表示を切り替えられます。CPUスパイクとストレージレイテンシの相関関係を確認する際に便利です。

2. ゲストOSの可視化レイヤーを追加

VMware APIはハイパーバイザー層の状況を詳細に取得できますが、VM内部の情報までは把握できません。全体像を把握するため、ハイパーバイザー指標とゲストOSのデータを併用します。

WindowsサーバーにはWMI、LinuxホストにはSNMPまたはSSHを使用し、ハイパーバイザー側の報告値とゲストOS内のアプリ実際の動作状況を比較検証します。

3. パフォーマンス基準値を作成

固定の閾値は誤った判断を引き起こす恐れがあります。バックアップ実行中のSQLサーバーではCPU使用率90%が正常でも、Webゲートウェイでは異常アラートとなるためです。

可能な場合はAI・機械学習機能搭載ツールを活用し、各業務システムの「正常な状態」を学習させます。これにより誤アラートを削減し、対応が必要な通知のみを抽出可能です。

4. 重要なアラートを設定

基準値を作成後、頻出するパフォーマンス異常に対しアラートを設定します。多くの管理者がまず以下の閾値を導入しています。

  • CPUレディ時間:5%を超過したらアラートを発報
  • メモリバルーニング:バルーンドライバーが稼働した時点で通知。ホストの物理メモリが過剰に割り当てられていることを示します。
  • データストア容量:80%で警告アラート、85%で重大アラートを設定し、容量不足によるVMクラッシュを防止

5. 統合ダッシュボードを構築

複数のツールやタブを切り替えて確認する手間を省きます。ホスト、VM、データストアの情報を集約した単一のダッシュボードがあれば、個別VMの画面では発見できないクラスタ全体の傾向(クラスタ全体でレイテンシが上昇するなど)を容易に把握できます。

VDI業務を運用している場合は、ダッシュボードにVMware Horizon監視セクションを追加します。セッション接続成功率とホスト健全性を並べて追跡することで、ネットワーク障害とサーバー側の問題を速やかに切り分けられます。

6. 自動修復を実装

本番環境の障害に対し手動対応では対応速度が追いつきません。成熟した監視環境の最終工程は、アラートを自動アクションと連携させることです。ITSMプラットフォームへチケットを起票する、PowerCLIスクリプトを実行しストレージ追加またはvMotionで負荷の高いVMを移行するといった処理を自動化します。

監視すべき主要VMwareパフォーマンス指標

安定したvSphere環境を運用するには、単にホストの稼働状況を確認するだけでは不十分です。優秀な運用チームは、ハイパーバイザーが共有リソースをどれだけ効率的に管理できているかを示す特定指標を追跡しています。

CPU関連指標

仮想化環境のCPUパフォーマンスは使用率の数値だけでは判断できません。より重要な判断基準は、VMが処理実行を必要とするタイミングでスケジューリングされているかどうかです。

  • CPU使用率とCPUレディ時間:使用率は消費した処理能力を示し、CPUレディ時間はVMがESXiホストの物理コアに割り当てられるまでの待機時間を表します。二つのうち、リソース競合を把握する実務的な指標はCPUレディ時間です。
  • 5%ルール:VMwareではCPUレディ時間が5%を超過した際にアラートを推奨しています。この数値に達すると、リソース競合の激化または単一VMに過剰なvCPUを割り当てている可能性が高いです。
  • CPU過剰割り当て比率:仮想CPUと物理コアの比率を指します。一般的に4対1が安全な基準とされ、環境規模拡大時に監視することでリソース枯渇を事前に検知可能です。

メモリ関連指標

vSphereは未使用VMからRAMを回収する複数の仕組みを搭載しているため、物理サーバーよりメモリ監視の判断が複雑になります。

  • 消費メモリとアクティブメモリ:消費メモリはVMが一度使用した総RAM量、アクティブメモリは現在実際に利用中のRAM量です。両者の差が大きい場合、VMに過剰なメモリを割り当てている可能性があります。
  • メモリバルーニングとスワップ:バルーンドライバー(vmmemctl)が稼働している場合、ESXiホストの物理メモリが不足しVMからメモリを回収している状態です。ホストがディスクへメモリをスワップし始めるとパフォーマンスが大幅に低下します。
  • 付与メモリ、予約メモリ、オーバーヘッドメモリ:重要業務システムが負荷時でも安定稼働するために必要な予約メモリを確保できているか確認するため追跡します。

ディスク・ストレージ関連指標

ストレージは仮想化環境で最も頻出するパフォーマンスボトルネックの一つであり、スループットと待機時間の両方を監視する必要があります。

  • ディスクI/Oレイテンシ:単位はミリ秒。VMwareの一般的なガイドラインでは総レイテンシ(GAVG)を20ms以下に抑えることが推奨され、定常的にこの数値を上回るとアプリの動作が顕著に遅延します。
  • IOPSとスループット:1秒あたりのI/O処理数とデータ転送量(MB/秒)の両方を追跡し、ストレージ負荷の全体像を把握します。
  • データストア容量:ストレージ容量の増加トレンドを監視し、スナップショットが知らず知らずのうちに空き領域を消費し容量枯渇する事態を防止します。

ネットワーク関連指標

仮想ネットワークのトラフィックは大半が物理ホスト外部に流出しないため、トラブルシュートが難しい傾向にあります。

  • パケット損失:vSwitchまたはポートグループでパケット損失数が多い場合、ネットワーク輻輳またはMTU設定の不整合が原因であると明確に判断できます。
  • 使用率とスループット:帯域利用量とスループットを組み合わせて確認することで、仮想NICの帯域を使い果たしネットワーク全体の劣化を引き起こしているVMを特定できます。

ホスト・クラスタ健全性

クラスタ層では、リソースの分散状況や耐障害機能が正常に動作しているか把握する必要があります。

  • HA・DRS稼働状況:vMotionの頻発は、クラスタの負荷分散が不均衡またはリソース不足のためDRSが過剰に調整を実行している可能性を示唆します。
  • ESXiホスト稼働時間・ハードウェアセンサー:接続状態、電源ユニット・ファンといった物理機器の状態を追跡します。ハードウェア異常を早期検知することで計画外のHAフェイルオーバーを回避できます。

早見表:指標閾値一覧

以下の閾値は汎用的な基準として広く活用されていますが、適切な数値は業務システムやストレージ種別によって変動します。

指標 警告閾値 重大閾値
CPUレディ時間 3% 5%
ストレージレイテンシ(GAVG) 20 ms 30 ms
データストア使用率 80% 90%
メモリスワップ速度 0 Kbps超 500 Kbps超
ネットワークパケット損失率 1% 5%

 

適切なVMware監視ツールの選定方法

最適な監視ツールは運用チームの規模、技術知識、予算によって異なります。標準搭載のvSphereツールだけで必要な機能を充足できる組織もあれば、ESXiホストまたはハイブリッドクラウド環境の詳細な可視化を実現するためサードパーティ製プラットフォームを導入する組織も存在します。

VMware標準搭載ツール

大半の管理者はvSphereライセンスに含まれる標準ツールから運用を開始します。

  • vSphereクライアント:すべてのvSphere運用者が使用する標準インターフェースです。リアルタイムのトラブルシュートや基礎的なパフォーマンス推移確認に適していますが、長期データ保存期間に制限があり、クラスタ横断の分析機能は搭載されていません。
  • VMware Aria Operations(旧vRealize Operations):大規模環境向けに設計され、予測分析、自動修復機能を搭載し、ダウンタイムが発生する前にリソース問題を特定可能です。

サードパーティ製VMware監視ツール

サードパーティ製ツールはVMware以外の基盤(物理ストレージアレイ、パブリッククラウドプラットフォームなど)との連携範囲が広く、柔軟なダッシュボードやアラート設定機能を提供する製品が多い特徴があります。

ツール名 推奨環境 主な特長
PRTG 中規模企業運用チーム 統合ダッシュボード上でCPU、メモリ、データストア容量を一括監視
Datadog ハイブリッドクラウド環境 オンプレミスとクラウドのVMware指標をリアルタイムダッシュボードに集約
SolarWinds VMAN 容量計画業務 VMリソース適正化提案、シナリオ別容量シミュレーション機能搭載
ManageEngine OpManager 自動化・コンプライアンス監査 パフォーマンス監視、容量計画、コンプライアンス監査を一体化
Netdata オープンソース・詳細指標取得 ESXiホスト、VM、データストア、仮想インターフェースの指標を1秒単位で収集
Veeam ONE バックアップと監視の両方を運用 リアルタイムパフォーマンスアラートとバックアップジョブの健全性確認を連携

 

選定基準

適切なツールを判断する主な3要素は以下の通りです。

  • 環境規模:小規模な構成では標準vSphereツールで十分です。複数拠点・複数クラスタに環境が拡大すると、大規模環境向けの集中可視化プラットフォームが必要になります。
  • 予算:追加ソフトウェアのサブスクリプションはVMware運用コストを増加させます。VMwareのみならずIT基盤全体をカバーするツールを選定することで監視費用を集約可能です。
  • 指標の詳細度:断続的なパフォーマンススパイクのトラブルシュートを行う場合は、短い間隔でデータを取得するツールを選びます。数分間隔でデータ収集する製品では、短時間発生する影響の大きい負荷変動を捕捉できない場合があります。
備考:購入前に現在利用中のvSphereバージョンとの互換性を必ず確認してください。サードパーティ製プラグインの対応がブロードコムの最新アップデートに遅れるケースがあります。

VMware監視のベストプラクティス

高性能なツールを導入しても、監視方針の設定・保守が適切でなければ早期障害検知は実現できず、障害発生後に原因調査に時間を費やすことになります。

間隔を空けず継続的に監視

顕著なパフォーマンススパイクが60秒以内に発生・収束するケースも存在します。監視ツールのデータ取得間隔が5分に設定されていると、この事象が履歴に残らず、ユーザーからの遅延報告に対し原因を特定できなくなります。

最新の監視ツールは30秒間隔でのデータ収集に対応しています。導入予定のツールがこの機能を搭載していない場合、本番vSphere環境の要求に対応可能か再検討してください。

閾値設定前に基準値を作成

ツール標準のアラート閾値は、固有の業務システムに適合しない場合が大半です。ドメインコントローラーと動画レンダリングサーバーでは正常時のCPU負荷パターンが大きく異なります。

カスタム閾値を設定する前に各業務システムを最低2週間観測します。これにより誤アラートを削減し、汎用的な既定値ではなく実際のアプリ動作に基づいた通知を設定できます。

アラート階層を分け、アラート疲れを抑制

すべての異常に即時対応する必要はないため、2段階の通知区分を導入し運用チームの対応優先度を明確化します。

  • 警告:データストア使用率75%到達、非重要VMのCPUレディ時間が閾値に接近といった、営業時間内に確認すべき事象
  • 重大:ホストの切断、本番サーバーのメモリディスクスワップ、データストア使用率90%超過など、即時対応を要する事象

定期的にリソースの浪費状況を監査

稼働中だが長期間使用されていないVMはCPU、メモリ、ストレージを消費し続け、サブスクリプション型ライセンスの場合は費用増加の要因にもなります。

vCenterのインベントリを定期的に確認し、30日間CPU使用率がほぼ0かつディスクI/Oが発生していないVMを洗出します。不要な業務システムを廃止することでリソースを解放し、ライセンス利用量の削減も実現可能です。

ライセンス変更情報を随時把握

一部のサードパーティ監視ツールはソケット数またはVM台数に応じて課金されます。環境の拡張・統合を実施する際、監視費用が基盤の成長速度を上回らないよう管理してください。

ブロードコムが随時実施するライセンス改定が、VMware製品群および上層のサードパーティツールにどのような影響を与えるか定期的に確認します。

運用Tips:vSphereクライアントのタグ機能を活用し、アプリまたは部門単位でVMをグループ分けします。これにより各ホスト上の業務システムの業務価値を反映した特化型ダッシュボードを簡単に作成できます。

監視だけでは不十分:VMware環境のバックアップを実施

監視は異常発生を通知するだけで、消失したデータを復旧する機能は持っていません。

多くのITチームは可視化ツールに多額の投資をする一方、バックアップを後回しにしがちです。これは重大な運用リスクとなります。VMware環境に適切なバックアップ方針を構築するには、本番環境にいかなる障害が発生しても復元可能な独立したデータ複製を作成する必要があります。

この課題を解決するため専用バックアップソリューションが不可欠です。i2Backupはエンタープライズ向けバックアッププラットフォームで、VMware環境に加え物理サーバー、データベース、非構造化データを単一管理コンソールから一括保護可能です。

i2Backupの主な機能

  • エージェントレスVMバックアップ:i2Backupは仮想化プラットフォーム標準APIを活用し、ゲストOS内にエージェントをインストールせずVMをバックアップします。バックアップ実行時に本番業務システムへの負荷がゼロとなるため、高密度VMware環境に必須の要件です。
  • 瞬時VMリカバリ:ホスト障害発生時、i2BackupはVMのバックアップイメージを対象プラットフォームに遠隔からマウント可能で、完全復元処理を待たず超高速で業務を再開できます。
  • ファイル単位・特定時点リカバリ:すべての復旧事案でVM全体を復元する必要はありません。i2Backupは任意の復元ポイントから特定のファイル、フォルダ、データベースレコードを抽出可能で、連続バックアップログにより正確な時点までデータを巻き戻せます。
  • 柔軟なスケジュール設定と自動クリーンアップ:1時間単位、毎日、任意の周期でバックアップジョブをスケジューリングできます。保存期間ポリシーに基づき古いバックアップを自動削除するため、手動操作なしでストレージ使用量を制御できます。
  • 集中管理:Web型コンソールからバックアップジョブの状況をリアルタイムで確認可能で、メール・SMSアラートにより複数システムにログインせず状況把握ができます。

バックアップ以上の機能を必要とするチーム向けに、Info2softはi2Availabilityも提供しています。VMwareその他の仮想化環境向けにリアルタイムレプリケーションと自動フェイルオーバーを実装し、本番障害発生時のRPOとRTOを最小限に抑えます。

監視とバックアップは組み合わせて活用することで最大の効果を発揮します。監視は異常の早期通知、バックアップは確実な復旧手段を提供し、二つが連携することで耐障害性の高いVMware環境の基盤を形成します。

60日間無料トライアル

まとめ

効果的なVMware監視は一度設定すれば完了する作業ではなく、環境の成長に合わせ継続的に見直す運用施策です。適切な指標、ツール、環境に適応した方針の3要素が不可欠です。

まず基礎から着手しましょう。ESXiホストとVM全体のCPUレディ時間、メモリ負荷、ストレージレイテンシ、ネットワーク健全性を追跡します。閾値設定前に基準値を作成し、アラート階層を分けて不要な通知を削減、定期的にコストを隠れて増加させるリソース浪費VMを監査します。

環境規模の拡大またはライセンス条件の変更に伴い、利用するツールを再検討してください。10台規模のクラスタに適したツールが、ハイブリッドクラウド拡張を伴う複数拠点構成では機能不足になるケースがあります。

最後に忘れてはならない点として、監視は異常を知らせるだけで、失われたデータを復旧することはできません。Info2softのi2Backupのような信頼性の高いバックアップソリューションと堅牢な監視方針を併用することで、可視性と復旧可能性が単独ではなく連携して機能する環境を構築できます。

概要は準備中です

関連記事

VMware、Azure、Hyper‑V におけるスナップショットからの VM 復元方法
更新が失敗したりシステムがクラッシュしたりした場合、スナップショットを利用すれば最初から再構築する代わりに瞬時にロールバックできます。本ガイドでは VMware、Azure、Hyper‑V における VM スナップショット復元の手順をステップバイステップで解説し、迅速な復旧とダウンタイムの最小化を実現します。
記事を読む
vSphere Replicationとは?手順付きセットアップガイド
業務停止が基幹ワークロードを脅かす場合、vSphere Replicationは仮想マシンを継続的に保護し、リカバリ可能な状態を維持します。本ガイドでは機能の解説、手順通りのセットアップ、ベストプラクティス、さらに業務継続性を強化するための追加の高可用性オプションを紹介します。
記事を読む
完全ガイド:VMware Remote Consoleのダウンロード・インストール手順
このガイドでは、Windows、Linux、macOS上で仮想マシンにリモート接続するためのVMware Remote Console(VMRC)のインストール手順と使用方法を解説します。また、VMRCの機能、ショートカット、WebコンソールやRDPとの違いについても記載しています。
記事を読む
VMware PowerCLIガイド:インストール、コマンド、スクリプト
VMware PowerCLIは管理者が簡単なPowerShellコマンドとスクリプトで反復的なvSphere作業を自動化するのを支援します。本ガイドではインストール方法、主要コマンドレット、実務向け自動化サンプル、日常的なVMware管理に役立つトラブルシューティングのコツを解説しています。
記事を読む
目次:
最新情報を購読
最新のインサイト、ニュース、限定コンテンツをお届けします。いつでも配信解除が可能です。
購読する
ビジネスデータのセキュリティ強化を始めませんか?
60日間の無料トライアルまたはデモで、Info2softが企業データをどのように保護するかをご確認ください。
フォームにご記入の上、送信してください。担当者より追ってご連絡いたします。
このフォームを送信することにより、 プライバシー通知を読み、同意したことを確認します。
{{ isSubmitting ? '送信中...' : '送信する' }}