一般的なワークフローの問題

これはあなたの週のように聞こえますか?

これらはエッジケースではありません。Vertex AIパイプラインを複数のツールで実行しているチームのための通常の運用条件です。Control-Mが各々をどのように処理するかは以下の通りです。

モデル学習

昨夜の学習実行が開始されました。特徴データセットは到着しませんでした。

Control-MはVertex AIジョブを開始する前に上流の依存関係を検証します。ファイルの到着、ETLの完了状態、データ品質チェックが自動的に評価され、無駄なコンピュートサイクルと失敗したモデル学習の実行を防ぎます。

SLAリスク

バッチスコアリングワークフローはすでに40分遅れています。

Control-Mは取り込み、変換、Vertex AI実行ステージ全体のワークフロープログレスを継続的に追跡します。予測SLA監視は締切が守られない前にリスクを特定し、警告や自動的な修正アクションをトリガーします。

ツール間の依存関係

Dataprocが完了しました。Vertex AIはまだ手動トリガーを待っています。

Control-Mは上流の完了イベントを検出し、依存するVertex AIワークフローを即座に開始します。イベント駆動のオーケストレーションはポーリング、スケジューリングのギャップ、手動介入を排除しつつ、完全な依存関係の可視性を維持します。

障害回復

1つの前処理タスクが失敗しました。パイプライン全体が一晩停止しました。

Control-Mは構成可能なリトライポリシー、例外処理、下流のカスケード防止を適用します。失敗したタスクは隔離され、回復ワークフローが自動的にトリガーされ、影響を受けないプロセスは適切な場所で実行を続けます。

モデル操作

モデルは正常にデプロイされました。誰も下流の配信を検証しませんでした。

Control-Mは、検証テスト、通知ワークフロー、データエクスポート、アプリケーションハンドオフを含むデプロイ後の活動を調整します。すべてのステップは単一のエンドツーエンドの生産ワークフローの一部として追跡されます。

統合の事実

Control-M + GCP Vertex AI

workload.types

モデルのトレーニング · バッチ予測 · AutoML パイプライン · カスタムトレーニングジョブ · 特徴エンジニアリングワークフロー · MLOps パイプライン · モデルのデプロイメント · ノートブック実行

trigger.type

ファイル到着 (Cloud Storage) · Pub/Sub イベント · API/ウェブフック · Vertex AI ジョブの完了 · 上流ワークフローの完了 · 時間スケジュール · データ品質検証

cross_tool.deps

Dataproc ジョブトリガー · BigQuery クエリの完了 · Dataflow パイプラインのステータス · Apache Airflow DAG トリガー · Cloud Storage ファイル検証 · REST API 呼び出し · 下流アプリケーションのデリバリー

cloud.platforms

Google Cloud Platform · ハイブリッドクラウド · マルチクラウドオーケストレーション · Control-M SaaS · Control-M オンプレミス

error_handling

設定可能なリトライカウント · インターバル · 下流カスケード防止 · 自動ワークフロー保持 · SLA の事前違反アラート · PagerDuty · Slack

throughput

大規模なモデルのトレーニング · 高ボリュームのバッチ推論 · イベント駆動のオーケストレーション · 並列ワークフロー実行 · 分散データ処理

observability

ジョブレベルの監査ログ · SLA トラッキングと違反予測 · 依存関係の系譜図 · Datadog 統合 · Splunk 統合 · 中央集権的なワークフローモニタリング

エンドツーエンドオーケストレーション

1つのプロダクションワークフロー。スタック内のすべてのツール。

Control-M は、Vertex AI、BigQuery、Dataflow、Dataproc、Airflow、Cloud Storage、およびクラウドサービス全体でワークフローを調整します。依存関係の追跡、SLA の可視性、および自動回復を実現します。

  • クロスツール依存関係: Cloud Storage → Dataflow → BigQuery → Vertex AI トレーニング → モデルデプロイメント
  • データ対応トリガー: ファイル到着、Pub/Sub event、BigQuery 完了、モデル検証結果

Vertex AI

トレーニングジョブのオーケストレーション · パイプラインの実行 · デプロイメントの調整 · ステータスのモニタリング

BigQuery

クエリ実行 · 依存関係管理 · データ検証 · 完了追跡

Dataflow

パイプライントリガー · ステータス監視 · SLA追跡 · 障害処理

Dataproc

Sparkワークロードオーケストレーション · 依存関係制御 · 自動回復

Cloud Storage

ファイル到着検知 · 検証 · イベントベースのトリガー

Apache Airflow

DAGトリガー · ステータストラッキング · クロスプラットフォームオーケストレーション

Google Cloud Services

APIオーケストレーション · ワークフロー自動化 · イベント調整

airflowの共存

Control-MはあなたのAirflow DAGを置き換えません。上にあるレイヤーを実行します。

反論は一般的です:"私たちはすでにAirflowを使用しています。" 問題はAirflowが何をするかではなく、Airflowが実行される前と後に何が起こるかです。パイプラインが実際に失敗するのはその部分です。

AirflowはそのDAGを管理します。Control-Mはそれを取り巻くすべてを管理します。

airflowは処理します

データパイプライン内のDAGレベルのオーケストレーション

  • データパイプライン内でのDAGレベルのタスクオーケストレーション
  • Pythonオペレーター、センサー、タスク依存関係
  • パイプライン内で実行されるジョブの実行グラフ
  • 単一DAGコンテキスト内でのリトライ管理

control-mが追加します

あなたのDAGの周りの調整レイヤー

  • DAGの周りの調整レイヤー - 上流の条件に基づいてAirflowをトリガーします:ファイルの到着、APIイベント、他のツールの完了
  • 各DAGのSLAの貢献をフルエンドツーエンドワークフロー全体で追跡します、自分のルーチンだけでなく
  • Airflowが始まる前に上流の依存関係が失敗した場合の障害回復を管理します
  • 既存のDAGは再記述または移行する必要はありません

パイプラインを監視する

データエコシステム全体でVertex AIワークフローを監視する。

Vertex AIはモデルの活動を可視化しますが、プロダクションワークフローは多くのプラットフォームにまたがります。Control-Mは、単一の運用ビューで取り込み、準備、トレーニング、デプロイメント、配信プロセス全体の集中監視を提供します:

  • エンドツーエンドワークフローの可視化

  • ランタイム履歴追跡

  • 上流依存関係ステータス

  • 下流配信監視

  • SLAリスク指標

SLA保証

モデル配信の約束を時間通りに守る。

機械学習ワークフローはしばしば複数のチーム、ツール、および依存関係を含みます。Control-Mはワークフローの進行状況を継続的に評価し、SLAリスクを予測し、モデルの消費者に遅延が影響を与える前に自動回復アクションを開始します:

  • 予測SLA監視

  • 自動エスカレーションワークフロー

  • 構成可能な回復アクション

  • 依存関係を考慮したスケジューリング

  • リアルタイムステータスアラート

複雑なワークフローに秩序をもたらす

Control-Mがチームに複雑なプロセスを可視化、調整、制御する手助けをする方法を学ぶ。