概要
Shannonは、予期しないLLM料金を防ぎ、支出を最適化するための包括的なコスト管理機能を提供します。組み込みの予算適用とインテリジェントルーティングにより、チームは素朴な実装と比較して**大幅なコスト削減(60~90%)**を実現することがよくあります(ワークロード依存)。予算の設定
予算はプラットフォームレベルで設定されます(REST経由のリクエストごとではありません)。.envで環境変数を使用:
Shannonは実行中に予算を適用します。制限に達すると、システムはさらなる支出を停止し、利用可能な最良の結果またはコンテキストに応じてエラーを返します。
モデルティア
Shannonは機能とコストに基づいてモデルをティアに分類します:明示的なティア設定
環境変数で優先デフォルトティアを設定:インテリジェントルーター
Shannonの学習ルーターは、各タスクを処理できる最も安価なモデルを自動的に選択します。仕組み
- タスク分析: 複雑さ、必要な機能を分析
- モデル選択: 最小の実行可能モデルから開始
- 品質チェック: 出力品質を検証
- 学習: 成功したモデル-タスクペアリングを記憶
コスト削減
ルーター決定の監視
ダッシュボードまたはSDKステータスを使用してコストを確認:レスポンスキャッシング
Shannonは冗長なAPI呼び出しを排除するためにLLMレスポンスをキャッシュします:キャッシュ戦略
- キー:
(messages + model + parameters)のSHA256ハッシュ - TTL: 設定可能(Redis TTL経由で通常約1時間)
- ストレージ: インメモリLRU + 分散キャッシング用のオプションRedis
- ヒット率: 本番ワークロードで通常30-50%
キャッシュの利点
キャッシュパフォーマンスの監視
プロバイダーレート制限
Shannonはプロバイダーのレート制限を自動的に尊重します:設定された制限
config/models.yamlから:
自動スロットリング
制限に近づくと:- リクエストをキューイング
- 時間をかけて負荷を分散
- 利用可能な場合は代替プロバイダーにフォールバック
コスト監視
タスクごとの支出を追跡
集計メトリクス
Shannonはメトリクスパイプライン経由で累積コストを追跡:- 日/週/月ごとの総支出
- ユーザー/チームごとのコスト
- 認知パターンごとのコスト
- トークン使用傾向
ベストプラクティス
1. 常に予算を設定
予算制限なしで本番タスクを実行しないでください:2. 可能な限りシンプルモードを使用
複雑なパターンはコストが高くなります:3. キャッシングを活用
繰り返しクエリの場合、キャッシュヒットを最大化するために一貫した表現を使用:4. 監視と最適化
コストメトリクスを定期的に確認:5. 最初に小さいモデルを使用
インテリジェントルーターに、より大きなモデルが必要な時を証明させる:コスト最適化チェックリスト
最適化チェックリスト
最適化チェックリスト
- 予算環境変数を設定(
MAX_COST_PER_REQUEST、MAX_TOKENS_PER_REQUEST) - 直接的なクエリには
# モード自動選択を使用 - レスポンスキャッシングを有効化(デフォルト: 有効)
- 適切な場合は
model_tier="small"を使用 - キャッシュヒットのためにクエリ表現を標準化
- ダッシュボードでコストメトリクスを監視
- 予算アラートを設定(Prometheus経由)
- プロンプトテンプレートを確認して最適化
- トークン使用量を減らすためにセッションコンテキストを使用
- 学習ルーターを有効化(デフォルト: 有効)
例: コスト最適化Workflow
次のステップ
ストリーミングイベント
リアルタイムタスク監視
設定
高度なコスト設定
API概要
エンドポイントと使用方法
監視
コスト監視UI