監視ドキュメントは開発中です。以下にコアコンセプトを概説します。
概要
Shannonは、本番環境でタスク実行、システムパフォーマンス、リソース使用状況を追跡するための包括的な監視および可観測性機能を提供します。監視機能
タスク監視
個別のタスク実行を追跡:- 実行ステータスと進捗
- リソース消費
- エラー率とタイプ
- レイテンシメトリクス
- コスト追跡
システム監視
Shannonインフラストラクチャを監視:- サービスヘルスステータス
- APIエンドポイントレイテンシ
- キューの深さ
- Agentの可用性
- LLMプロバイダーステータス
メトリクス
タスクメトリクス
システムメトリクス
ヘルスチェック
APIヘルス
コンポーネントヘルス
ログ
ログレベル
Shannonは以下のレベルで構造化ログを使用:DEBUG- 詳細な診断情報INFO- 一般的な運用メッセージWARN- 警告状態ERROR- エラー状態FATAL- 重大な障害
ログフォーマット
ダッシュボード
タスクダッシュボード
リアルタイムでタスク実行を監視:- アクティブなタスク
- 完了率
- 平均レイテンシ
- エラー率
- 時間あたりのコスト
システムダッシュボード
システムヘルスを追跡:- サービスステータス
- リソース使用率
- キューの長さ
- プロバイダーの可用性
アラート
アラートタイプ
以下のアラートを設定:- タスク失敗
- 予算超過
- 高レイテンシ
- サービス劣化
- レート制限
アラート設定
Prometheus統合
Prometheusにメトリクスをエクスポート(ローカル開発用のスクレイプターゲット例):利用可能なメトリクス
Grafanaダッシュボード
以下のための事前構築Grafanaダッシュボード:- タスク分析
- コスト追跡
- パフォーマンス監視
- エラー分析
OpenTelemetry
Shannonは分散トレーシングのためにOpenTelemetryをサポート:ベストプラクティス
- 重要なメトリクスのアラートを設定
- 予算超過を防ぐためにコストを監視
- 問題を特定するためにエラーパターンを追跡
- デバッグに分散トレーシングを使用
- コンプライアンスのためにログをアーカイブ
- ユースケースに合わせたカスタムダッシュボードを作成
- 信頼性のためにSLOを実装
デバッグ
デバッグログを有効化
リクエストのトレース
OpenTelemetry経由で分散トレーシングを使用するか、サービスのログ詳細度を上げます。エクスポーターについては可観測性スタック設定(Jaeger/Tempo)を参照してください。次のステップ
トラブルシューティング
一般的な問題と解決策
コスト管理
コストの管理と最適化