Beating AI monitoringによると、Clineは実際の本番環境でKimi K2.6のセルフホスティングコストを計算しました。API経由で月間5.83 billion tokensを処理する費用は、約$185,000です。残りのリクエストをAPIにルーティングしつつ、ベースラインのトラフィックに対して16台のNVIDIA B200 GPUを満員(フル稼働)で運用すると、請求額は$166,000まで下がり、節約は約10%にとどまります。
Clineは、動的なGPUスケジューリングにより、節約を22%-25%まで伸ばせる可能性があると見積もっています。さらに最適化すれば35%-40%に達する可能性もありますが、これらの戦略は本番環境では未検証のままです。同社は、年間のAPI支出が$500,000-$2 millionを超える場合にのみ、セルフホスティングが経済的に採算に合うと結論づけています。これ以下の水準では、一般にインフラとエンジニアリングのコストが節約分を上回ります。