メインコンテンツまでスキップ

異常管理(Anomaly Management)

ドラフトのページ

翻訳は機械翻訳により提供されています。 翻訳内容と英語版の間で齟齬、不一致、矛盾がある場合は英語版を優先します。

フレームワーク / ドメイン / 使用量とコストの理解 / 異常管理

このページの内容

リスクを低減し、費用対効果の高い運用を確保するために、予期しない、または予測されていないテクノロジーコストと使用量の異常をタイムリーに検知、特定、アラート、管理します。

異常の検知

  • 異常な支出を検知するために使用するツールを定義する
  • アラートの作成およびログ記録の方法を特定し、文書化する
  • 責任者を特定する方法を特定し、文書化する
  • 適切なチャネルを使用して、適切な関係者にタイムリーにアラートを送信する仕組みを設定する

異常検知の有効化

  • 効果的な運用のために必要な情報を定義し、データ取り込み(Data Ingestion)にフィードバックする
  • 異常管理に関するポリシーを作成する

異常の管理

  • 報告された異常を分析する
  • カテゴリ分け、誤検知の管理、調査を行う
  • 異常とその解決策を文書化する

定義

異常管理により、FinOpsチームは予期しないコストイベントをタイムリーに検知、特定、明確化、アラート、管理し、ビジネスへの影響を最小限に抑えられます。

異常の管理には、予期しない支出を特定するためのツールやレポートの使用、異常アラートの配信、および異常な使用量やコストを調査して解決するための情報の活用が含まれます。

FinOpsの文脈において、異常とは、過去の通常の支出や予測される支出とは異なる(通常はより高い)支出レベルを指します。

異常検知は、データセットの通常の挙動から逸脱するデータポイント、イベント、または観測結果を特定します。検知ツールは、全体の合計使用量だけでなく、サブカテゴリ内の使用量も調査する必要があります。効果的な配賦(Allocation)メタデータは、効果的な異常検知を行うため、また検知された異常を誰が最も適切に評価し解決できるかを判断するために不可欠です。

サービス別、アカウント/プロジェクト別、コスト配分(Cost Allocation)タグ別などの詳細なコスト粒度を提供する異常検知ツールを導入することは、異常な支出の具体的な原因を特定するために不可欠です。

異常が発生した際にFinOpsチームが迅速に対応するためには、異常検知と分析の標準手順が不可欠です。一般的には、機械学習ベースの自動化された異常検知が使用されます。これらのツールは、通常、データやテクノロジーのプロバイダー、またはサードパーティのプラットフォームによって提供されます。

多くのFinOpsケイパビリティと同様に、異常検知は現在の使用量と過去の使用量を比較することで実行します。そのため、新しい使用量や支出の急激な増加は、それが予期されていたものであっても異常アラートをトリガーすることがあります。例えば、新しいトレーニング環境サービスが立ち上がり、これまで大きなコストが発生していなかったアカウントで使用量が急増する場合などです。このような場合、チームは異常アラートが発生することを想定し、アラート発生時に効果的に管理および文書化する必要があります。これにより、他のペルソナによる不要な対応作業が発生するのを防ぎます。

異常の管理と解決には、通常、ある程度の調査が必要であり、その後、環境を調整するための変更を行うか、影響を受けるスコープのコスト予測を調整します。また、単に異常を認識し、それが検知された理由を文書化するだけで解決とする場合もあります。

成熟度アセスメント

クロール

  • FinOpsチームおよび組織全体が、異常な支出が発生する可能性を理解している
  • レポートを使用して、異常な支出を手動で確認している
  • 異常が発生してから対応するまでに1週間以上かかっている(請求データの受信後)
  • 異常検知サービスの代わりに予算アラートを使用している
  • 詳細な検知が制限されており(例:アカウント/プロジェクトレベル、タグデータや論理的グループ化を使用していない)、特定された異常な支出から得られるインサイトの文脈が最小限にとどまっている
  • 異常アラートが中央チームに送信されるか、確認するために手動の操作が必要である
  • 予期しない支出は中央チームが手動で調査し、必要に応じて想定される所有者に解決を依頼している

ウォーク

  • 何らかの形式の自動検知、レポート、またはツール(通常はテクノロジーサービスプロバイダー、サードパーティ、またはカスタムツールによって提供される)を導入している
  • ほとんどまたはすべての部門やチームが、異常検知ツールに関する知識を持ち、それを使用している
  • 文脈に応じたしきい値を検知している(支出変化の割合、単一アイテムの支出額の上限、予測超過アラートなど)
  • コスト配分メタデータが異常をセグメント化するための文脈を提供し、分析を容易にしている
  • 予期しない支出が、担当チームに自動的にルーティングされる
  • 異常管理に関連するKPIが設定され、組織内の主要なチームで使用されている
  • アラートが発生した異常の結果を文書化し、その詳細の一部を記録できている

ラン

  • 成熟した異常検知ツールが使用され、組織全体のツール群に組み込まれている
  • 適切な環境において適切な重要度で、異常な支出アラートを検知、解決策を提案、または解決するための自動化が構築されている
  • 適切な規模や緊急度を持つ異常アラートを、イベント管理やチケット管理のシステムおよびプロセスに統合できる
  • サービスコンポーネントに直接リンクされた、詳細で文脈に関連する異常アラートのしきい値が設定されている
  • アラートのしきい値が、サービスのライフサイクルに合わせて繰り返し更新されている
  • 異なるペルソナや責任レベルに応じて、アラートとしきい値が個別に設定されている(例:リーダーシップ、FinOpsチーム、エンジニアリング、財務は、それぞれの行動や情報収集のしきい値に基づいて、異常な支出からのアラートを異なる方法で確認できる)
  • 各異常アラートの結果と解決策が記録されている
  • 必要に応じて、分析結果に基づき完全な根本原因分析(RCA:Root Cause Analysis)のポストモーテム(事後検証)が実施される
  • 過去の異常解決の分析により、将来の異常に対するアラート精度が向上している

実務活動

FinOps実践者

FinOpsチームのロールとして、私は以下を行います。

  • コスト監視に適しており、予期しない支出イベント(コスト異常)を定義、洗練、検知、およびアラート通知できる異常検知ツールの選定要件を確立する
  • 異常の自動化および文書化ツール、またはプロセスの要件を確立し、既存の適切なチケット管理やプロセス管理システムとの統合を行う
  • 異常検知の仕組みとしきい値を文書化し、すべてのステークホルダーに伝達する
  • ステークホルダーチームと協力して、異常検知のしきい値とレポート/通知の頻度を設定する
  • 異常検知がコスト配分メタデータに適切に紐付けられていることを確認し、追加のメタデータが必要な場合は配賦ケイパビリティにフィードバックを提供する
  • 異常検知ツールが、適切なリアルタイムの粒度と頻度で未加工の支出データにアクセスできるようにする
  • すべて、またはアラートが発生した異常な支出を明らかにするレポートを生成する

エンジニアリング

エンジニアリングのロールとして、私は以下を行います。

  • 私のチームが異常な支出アラートを確認、または受信していることを確実にする
  • 私のチームが、コスト異常に対応し対処するための正しいプロセスとアクションを認識していることを確実にする
  • 異常検知を実行できるように、私が管理するリソースに適切なメタデータが適用されていることを確実にする
  • 設定されたしきい値や検知範囲の正確性について、FinOpsチームにフィードバックを提供する
  • 検知された異常の原因と範囲を調査・特定し、誤検知やアクションプランを文書化する
  • 異常な支出の原因となっている問題を解決し、異常の解決策を文書化する
  • 懸念を引き起こすような異常アラートを発生させる可能性のある、計画された大規模で予期しない異常な支出(例:新しい環境の立ち上げなど)について、他のペルソナにプロアクティブに警告する

プロダクト

プロダクトのロールとして、私は以下を行います。

  • 私の責任範囲内のシステムについて、検知および報告された異常を監視し調査する
  • 私の責任範囲内のエンジニアリングチームと協力して、報告された異常の調査と解決を支援し、その解決策を文書化する

財務

財務のロールとして、私は以下を行います。

  • 予算と実績支出の財務レビューをトリガーする、異常な支出割合のしきい値の設定を支援する
  • 設定されたしきい値に沿った異常な支出傾向に対応するため、予測内のコストに予備の資金源を確保する

リーダーシップ

リーダーシップのロールとして、私は以下を行います。

  • 対応や注意をトリガーする、異常な支出割合のしきい値を設定する
  • OKRやKPIに関連するガイドラインとサポートポリシーを提供し、エンジニアリングチームおよびプロダクトチームによる異常管理活動を義務付ける

成功指標とKPI

  • 一定期間内(週、月)における、全体または有意義な使用量サブセットごとの異常の件数
  • 異常な支出の特定、見落とし、および誤検知の一貫した識別
  • 一定期間内(週、月)の異常アラートに関連するコスト額(全体の異常検知範囲を示す)
  • 一定期間内(週、月)における異常検知の平均時間(MTTD:Mean Time to Detect)(使用したツールの効率性と有効性を示す)
  • 一定期間内(週、月)における異常の所有者への平均通知時間(異常検知から適切な所有者がそれを認識するまでにかかる時間を示す)
  • 一定期間内(週、月)における未解決の異常の継続期間(異常解決の迅速性を示す)
  • 特定された異常の調査および対処にかかる時間(多くの場合、本物の異常の調査時間は、リアルタイムで無駄になっているコストを意味する)
  • 変動費がどのように異常な支出につながるか、何が異常であるかの定義、誰に責任があるか、および対応方法について教育を受けたチームの割合(%)
  • 対応された異常の件数と回避された支出額(直近の次の請求期間まで)(請求書を受け取るまで未解決のまま放置されていたであろう異常を解決することで節約されたコスト額)
  • 対応不可の異常の件数、およびカテゴリ分けされたが無視する正当な理由があるもの(例:新規サービス、性能テスト、顧客のピーク、誤アラート)のカテゴリ別の件数
  • プロトコルやポリシーを遵守していない可能性のあるチームを特定するための、一時停止(無視)されたアラート数の追跡
  • さまざまなカテゴリの自動化を使用して管理された異常の割合(%)(導入された自動化の有効性を示す)

KPI

異常検知率(Anomaly Detection Rate)

AI支出における異常(急激なコストスパイクや予期しない使用パターンなど)の頻度とコストへの影響を測定します。このKPIにより、制御不能なコストのプロアクティブな特定と抑制が可能になります。

詳細を読む

総予測外支出変動(Total Unpredicted Variance of Spend)

一定期間に記録されたCSP(クラウドサービスプロバイダー)のクラウド利用に関連する、予測されなかったコストの変動を測定します。

詳細を読む

異常検知によるコスト回避額(Anomaly-Detected Cost Avoidance)

異常を特定し修正した結果として回避されたコストの額を測定します。

詳細を読む

インプットとアウトプット

  • データ取り込みケイパビリティを介して提供されるコストと使用量データ
  • 異常検知ツール(データプロバイダー、ツールベンダー、自社開発ツール)
  • 組織のレポート要件に合わせて確立および調整されたコスト配分メタデータ
  • 監視を担当する特定のチームに使用量を割り当てる配賦戦略
  • ステークホルダーチームへの異常な支出の通知
  • コストおよび使用量のレポートデータに対するステークホルダーのリアルタイムの可視性
  • 異常管理の期待値に関連するポリシーとガバナンス
  • 検知、分析、解決プロセス、およびペルソナへの期待値の文書化
  • 異常な支出を調査および分析するために、レポートと分析(Reporting & Analytics)が必要となる
  • 使用量に起因する異常な支出の原因を修正するため、または使用されていないリソースを停止するために、ワークロードの最適化が必要となる場合がある

以前の「異常の管理」ページを表示

このページの内容

関連アセット

クラウドコスト異常の管理 異常管理ストーリーコレクション FinOpsPod 22:コスト異常と傾向のトラブルシューティング戦略 FinOpsPod 29:クラウドコスト異常:検知と管理の方法 数百万ドル規模のクラウド支出における異常検知 Palo Alto Networksにおける異常検知とユニットエコノミクスがもたらす成長 コスト異常と傾向のトラブルシューティング戦略(Under Armour) 異常な、制御不能となったデータ分析コストへの対処 異常検知によるコスト回避額の測定プレイブック