メインコンテンツへスキップ

概要

Shannonは、予期しないLLM料金を防ぎ、支出を最適化するための包括的なコスト管理機能を提供します。組み込みの予算適用とインテリジェントルーティングにより、チームは素朴な実装と比較して**大幅なコスト削減(60~90%)**を実現することがよくあります(ワークロード依存)。

予算の設定

予算はプラットフォームレベルで設定されます(REST経由のリクエストごとではありません)。.envで環境変数を使用:
Shannonは実行中に予算を適用します。制限に達すると、システムはさらなる支出を停止し、利用可能な最良の結果またはコンテキストに応じてエラーを返します。

モデルティア

Shannonは機能とコストに基づいてモデルをティアに分類します:

明示的なティア設定

環境変数で優先デフォルトティアを設定:

インテリジェントルーター

Shannonの学習ルーターは、各タスクを処理できる最も安価なモデルを自動的に選択します。

仕組み

  1. タスク分析: 複雑さ、必要な機能を分析
  2. モデル選択: 最小の実行可能モデルから開始
  3. 品質チェック: 出力品質を検証
  4. 学習: 成功したモデル-タスクペアリングを記憶

コスト削減

ルーター決定の監視

ダッシュボードまたはSDKステータスを使用してコストを確認:

レスポンスキャッシング

Shannonは冗長なAPI呼び出しを排除するためにLLMレスポンスをキャッシュします:

キャッシュ戦略

  • キー: (messages + model + parameters)のSHA256ハッシュ
  • TTL: 設定可能(Redis TTL経由で通常約1時間)
  • ストレージ: インメモリLRU + 分散キャッシング用のオプションRedis
  • ヒット率: 本番ワークロードで通常30-50%

キャッシュの利点

キャッシュパフォーマンスの監視

プロバイダーレート制限

Shannonはプロバイダーのレート制限を自動的に尊重します:

設定された制限

config/models.yamlから:

自動スロットリング

制限に近づくと:
  1. リクエストをキューイング
  2. 時間をかけて負荷を分散
  3. 利用可能な場合は代替プロバイダーにフォールバック

コスト監視

タスクごとの支出を追跡

集計メトリクス

Shannonはメトリクスパイプライン経由で累積コストを追跡:
  • 日/週/月ごとの総支出
  • ユーザー/チームごとのコスト
  • 認知パターンごとのコスト
  • トークン使用傾向
Prometheus/Grafana(設定後)または可観測性スタックを使用してこれらのメトリクスを可視化します。Desktop AppのRunsビューもタスクごとのコストの検査に役立ちます。

ベストプラクティス

1. 常に予算を設定

予算制限なしで本番タスクを実行しないでください:

2. 可能な限りシンプルモードを使用

複雑なパターンはコストが高くなります:

3. キャッシングを活用

繰り返しクエリの場合、キャッシュヒットを最大化するために一貫した表現を使用:

4. 監視と最適化

コストメトリクスを定期的に確認:

5. 最初に小さいモデルを使用

インテリジェントルーターに、より大きなモデルが必要な時を証明させる:

コスト最適化チェックリスト

  • 予算環境変数を設定(MAX_COST_PER_REQUESTMAX_TOKENS_PER_REQUEST
  • 直接的なクエリには# モード自動選択を使用
  • レスポンスキャッシングを有効化(デフォルト: 有効)
  • 適切な場合はmodel_tier="small"を使用
  • キャッシュヒットのためにクエリ表現を標準化
  • ダッシュボードでコストメトリクスを監視
  • 予算アラートを設定(Prometheus経由)
  • プロンプトテンプレートを確認して最適化
  • トークン使用量を減らすためにセッションコンテキストを使用
  • 学習ルーターを有効化(デフォルト: 有効)

例: コスト最適化Workflow

次のステップ

ストリーミングイベント

リアルタイムタスク監視

設定

高度なコスト設定

API概要

エンドポイントと使用方法

監視

コスト監視UI