計算ツール
ITAPILLMクラウド

API呼出コスト 計算ツール|LLM・決済・SMS・クラウドの月額試算とプロンプトキャッシュ最適化

LLM(最上位/上位バランス型/軽量/超軽量の各モデル階層)、オンライン決済API、SMS配信API、メール配信API、APIゲートウェイ、エッジ実行環境の月額コストを、公表レートの水準に基づき即算出。入力/出力トークン単価、プロンプトキャッシュ、バッチAPI割引50%、Rate Limit、モデル階層の選び分けによるコスト削減10〜30倍まで反映。SaaS開発、AI事業、社内自動化、EC決済連携の予算策定に必須の実務データを1枚に凝縮しました。

最終更新:2026-08-05/監修:計算ツールズ編集部

API呼出コストツール

計算式と課金体系

LLM APIの基本式

LLM月額 = (入力トークン数 × 入力単価 + 出力トークン数 × 出力単価) × 月間呼出回数
プロンプトキャッシュ適用時 = キャッシュ命中分 × キャッシュ単価(10%程度)+ 未命中分 × 通常単価
バッチAPI = 通常単価 × 50%

主要なLLM APIはいずれもトークン単位課金です。入力(プロンプト+コンテキスト)と出力(生成結果)に別レートが設定され、出力側の方が3〜5倍高いのが業界標準です。1トークンは英語で約4文字、日本語で約1〜2文字が目安。

USD/JPY換算

本ページのJPY表示は1 USD = 150円換算。実際の為替レートで変動するため、大規模利用時は為替ヘッジを検討してください。年間$100,000の利用なら、150円→160円への円安で年間100万円のコスト増となります。

非LLM APIの課金モデル

オンライン決済API:取引金額×3.6%前後(+固定手数料の場合あり)。SMS配信API:1通あたり定額(日本国内0.075USD前後)。メール配信API:送信通数×単価。APIゲートウェイ:リクエスト数(100万件$3.5前後)+データ転送量。エッジ実行環境:無料枠あり(10万リクエスト/日前後)、超過分$0.15/100万リクエスト前後。非LLMは「従量の単位が回数か金額か」で見積もり方が変わる点に注意してください。

LLM主要APIレート早見表(2026年8月時点)

LLMは提供元が違っても性能帯(階層)ごとに単価水準がほぼ揃います。以下は階層別の代表的な水準で、上の計算機と同じ数値です。

モデルの階層入力(1M tokens)出力(1M tokens)キャッシュ入力特徴
最上位モデル$15$75$1.5最高性能、複雑な推論・長い計画立案
上位バランス型モデル$3$15$0.3バランス型、実務の標準的な選択
軽量モデル$0.8$4$0.08高速・低コスト、分類や要約に十分
中位マルチモーダルモデル$2.5$10$1.25画像・音声を含む入力に対応
超軽量モデル$0.15$0.6$0.075超低コスト、単純なタスク向け
推論特化モデル(上位/軽量)$15 / $1.1$60 / $4.4思考過程に多くのトークンを使う分、実効コストは高め
長文コンテキスト対応の中位モデル$1.25$5$0.3125200万トークン級の長文入力に対応
長文コンテキスト対応の超軽量モデル$0.075$0.3$0.019高速・最安クラス
オープンウェイトモデル(推論API事業者経由)$0.6$0.6入出力同一単価、自社ホスティングも可能
低価格帯のオープンウェイトモデル$0.27$1.10$0.07低価格・重みが公開されている

単価は1M(100万)トークンあたり。実務では上位バランス型や中位マルチモーダルが標準で、簡単なタスクを軽量・超軽量に振り分けると10〜30倍のコスト削減になります。選ぶ観点は「必要な推論の深さ」「入力の長さ」「マルチモーダルの要否」「出力トークン量」の4点です。

決済・SMS・メールAPIレート(2026年8月時点)

非LLMのAPIはサービス種別ごとに課金の単位が決まっているため、事業者名より「どの種別か」で相場を押さえるほうが実務的です。

サービスの種別料金の水準備考
オンライン決済API(国内カード決済)取引額×3.6%(主要2ブランド)/3.75%(一部ブランド)固定手数料なしの事業者が主流。返金しても手数料は返還されない
オンライン決済API(ウォレット型)取引額×3.6%+40円前後越境決済は+1%程度
SMS配信API(日本国内)1通あたり$0.075(約11円)送信失敗も課金対象になる事業者が多い
SMS配信API(米国内)1通あたり$0.0079国内の1/10以下
メール配信API(無料プラン)月100通まで無料個人・テスト用
メール配信API(標準プラン)月$19.95〜(4万通/月)企業標準の価格帯
メール配信API(大手クラウド従量型)1,000通あたり$0.10最安値、SPF/DKIM設定が必須
APIゲートウェイ(REST)100万リクエスト$3.50データ転送量は別課金
サーバーレス関数100万リクエスト$0.20+GB秒課金無料枠100万リクエスト/月が一般的
エッジ実行環境(無料プラン)10万リクエスト/日無料個人・小規模
エッジ実行環境(有料プラン)$5/月(1,000万リクエスト込み)大量トラフィック対応
ホスティングPaaS(無料プラン)無料(100GB帯域まで)個人・ポートフォリオ
ホスティングPaaS(有料プラン)$20/月+従量課金企業標準

プロンプトキャッシュとバッチAPI

プロンプトキャッシュ(主要LLM各社が提供)

同じシステムプロンプトを繰り返し送る場合、キャッシュにヒットしたトークンは通常単価の1/10〜1/2で計算されます。上位バランス型なら$3/M→$0.3/M、中位マルチモーダルなら$2.5/M→$1.25/Mというのが典型です。長いシステムプロンプト(ドキュメント参照型)で50〜80%のコスト削減が可能。TTLは5分〜1時間。

バッチAPI(50%OFF)

主要なLLM提供事業者はいずれも、24時間以内に処理する非同期バッチAPIを用意しています。通常単価の50%OFFで処理できます。ユーザー対話ではなくバックエンド処理(要約、翻訳、分類、埋め込み計算)向け。

ストリーミング vs 一括レスポンス

コスト自体は同じですが、ストリーミングはユーザー体験(TTFT改善)に寄与。長文生成では体感速度が数倍向上します。バックエンド処理では一括レスポンスの方が並列制御が容易。

Function Calling / Tool Use

関数呼び出しはトークン消費が増えるため、コスト上昇要因。ただしJSONモード指定で構造化出力を強制する場合、Function Callingを使わずシステムプロンプトで指示する方が安いケースも。

Rate Limitと同時実行数

従量課金でも、1分あたりのリクエスト数(RPM)とトークン数(TPM)に上限があります。上限は利用実績と入金額に応じた「Tier」で段階的に上がるのが各社共通の仕組みです。

モデルの階層TierRPMTPM(tokens/分)
中位マルチモーダルモデル最下位Tier50030,000
中位マルチモーダルモデル最上位Tier10,0002,000,000
上位バランス型モデル最下位Tier5040,000(入力)+ 8,000(出力)
上位バランス型モデル上位Tier4,0004M+800K
長文コンテキスト対応モデル無料枠151M/日
長文コンテキスト対応モデル有料3604M

Rate Limitに到達した場合はExponential Backoff(指数バックオフ)でのリトライ実装が必須です。急激なトラフィック増加時は事前に上位Tierへの申請、または複数事業者の併用(フォールバック)を推奨します。

コスト削減パターン

モデル選択の最適化(10〜30倍削減)

すべて最上位モデルで処理せず、簡単なタスクは軽量・超軽量モデルにルーティングします。難易度判定→軽量→不十分なら上位バランス型→さらに不十分なら最上位、という多段階運用で全体コストを1/10に。

プロンプトキャッシュ(50〜80%削減)

長いシステムプロンプト・RAGドキュメントをキャッシュ。同一システムプロンプトを1時間に100回呼ぶ場合、キャッシュ入力単価が通常の1/10なので、全体コストは30〜60%削減。

バッチAPI(50%削減)

ユーザーがリアルタイムを求めないタスク(サマリー生成、翻訳、埋め込み、データ分類)はバッチAPIで50%OFF。

セマンティックキャッシュ(80〜95%削減)

類似した質問を検知して、過去の回答を再利用する自前キャッシュ層。インメモリKVS+ベクトルDBで実装。FAQ型・商品説明型アプリでは劇的にコスト削減。

コンテキスト圧縮

長いチャット履歴を要約してコンテキストに埋め込むと、入力トークンを1/5〜1/10に圧縮可能。ロスがあるがコスト削減効果は大きい。

OSSモデルへの移行

重みが公開されているオープンウェイトモデルを推論API事業者経由で使うと、中位マルチモーダルモデルの1/5〜1/10のコストになります。自社GPUでホスティングすれば時間課金モデルでさらに削減可能です。

こんな場面で使う

SaaS事業のAI機能追加

顧客あたり月間LLM利用量を試算し、価格設定・利益率を検証。ユーザー1人月間$5のコストならプランは$29が最低ライン。無料ユーザー比率を含めた実効ARPUで検討します。

社内自動化ツール開発

ドキュメント要約・議事録生成・メール自動返信などの社内利用。月100〜1,000呼出で$5〜50程度に収まる規模です。ビジネスチャットへの統合が業務浸透の鍵になります。

ECサイトの決済連携

決済APIの3.6%前後の手数料は取引額に比例します。月商1,000万円なら36万円/月が決済事業者へ。年間450万円のコストとして事業計画に組み込みます。返金しても手数料は返還されないため、返品率が高いモールでは要注意。

大規模データ処理・分類

100万件のテキスト分類なら、バッチAPI+軽量モデルで約$50〜100で完了できます(中位マルチモーダルなら$500〜1,000)。1件$0.0001の世界で、AIコストは劇的に下がっています。

チャットボット構築

FAQ型ボットは、セマンティックキャッシュ+軽量モデル+RAGで1問$0.01以下になります。有人サポート1時間$30と比べて圧倒的なコスト優位です。

よくある間違い・注意点

  • すべて最上位モデルで固定 — 最上位・中位モデルで全処理すると本来の10〜30倍のコストになります。難易度別ルーティングで大幅に削減できます。
  • キャッシュ設計を怠る — 同一システムプロンプトを繰り返し送る場合はプロンプトキャッシュを必ず使用。実装しないと本来単価の10倍を払い続けることになります。
  • トークン数の見積もりミス — 日本語1文字≒1〜2トークン。会話履歴を蓄積すると入力トークンが指数的に増加します。各社が公開しているトークナイザのライブラリで事前見積もりを。
  • Rate Limitに達したら諦める — Exponential Backoff実装で自動リトライ、または複数事業者のフォールバックで解決できます。上位Tier申請も選択肢です。
  • 為替リスクの無視 — 海外事業者のAPI請求はほぼUSD建てです。150円→160円の円安で年間コスト7%増。大規模利用なら為替ヘッジや複数リージョン利用を検討してください。
  • 決済手数料を利益率計算で忘れる — 3.6%前後は税抜取引額に対するものです。粗利率10%の商品なら実質純利6.4%まで下がるため、値付けへの反映が必要です。
  • SMSは送信失敗も課金される — 番号不通・キャリア規制による送信失敗も1通としてカウントされる事業者が多い。無効番号を除くフィルタで削減できます。

関連する規約・法令

  • LLM提供事業者の利用規約・利用ポリシー ― コンテンツポリシー、学習データへの利用可否、商用利用の範囲、禁止用途。出力の権利がユーザーに帰属するかは規約で確認を。
  • 決済代行事業者の利用規約 ― 決済処理、返金、チャージバック対応、本人確認(KYC)義務。
  • SMS配信事業者の利用規約 ― SMS/音声通信の規制、米国の番号登録規制、日本国内のSMS配信規制。
  • 個人情報保護法 ― LLMに個人情報を送信する場合の同意取得・匿名化要件。
  • 特定商取引法 ― 決済API利用時の表示義務。
  • 資金決済法 ― プリペイド/前払式支払手段の発行者責任。
  • GDPR ― EU居住者データを扱う場合の適合性、DPA締結。

参考文献・公的資料

API料金・規約の最新情報は、各社公式ドキュメントを必ずご確認ください。

  • 各LLM提供事業者の料金ページ ― モデル階層ごとの入力/出力トークン単価、プロンプトキャッシュの単価とTTL、バッチAPI割引率。改定が頻繁なので契約前に必ず確認を。
  • 各LLM提供事業者のRate Limitドキュメント ― Tierごとの RPM/TPM、上位Tierへの昇格条件(累計課金額・経過日数)。
  • クラウド事業者のAPIゲートウェイ/サーバーレス料金ページ ― リクエスト単価、データ転送量の別課金、無料枠の範囲。
  • 決済代行事業者の料金ページ ― 国内カード決済率、ブランド別の差、越境決済の上乗せ、返金時の手数料の扱い。
  • SMS・メール配信事業者の料金ページ ― 国別のSMS単価、送信失敗時の課金有無、メールの通数プラン。
  • 経済産業省 情報経済 ― データ保護・AI利用ガイドラインの一次資料。
※本ページの料金情報は、2026年8月時点で各社が公表しているレートをサービス種別・モデル階層ごとに代表化した概算です。トークン単価・為替・キャッシュ制度は頻繁に変更されるため、実運用時は必ず各社公式ドキュメントを確認してください。個人情報・機密情報を含む場合はデータ処理契約(DPA)締結や、オンプレミス/プライベートLLMの利用も検討してください。

よくある質問(FAQ)

LLM APIで一番安いモデル階層は?

超軽量モデル(入力$0.075〜0.15/M)と軽量モデル($0.8/M)が低コスト帯です。中位マルチモーダル($2.5/M)と比べて10〜30倍安く、簡単な分類・要約・翻訳タスクなら十分こなせます。

プロンプトキャッシュの効果は?

キャッシュ命中トークンは通常単価の1/10。長いシステムプロンプト(RAG、指示書、ドキュメント参照)で50〜80%コスト削減可能。TTLは5分〜1時間程度で、頻繁に呼ぶAPI向け。

バッチAPIとは?

24時間以内に処理する非同期APIで、通常単価の50%OFF。リアルタイム性が不要なバックエンド処理(データ分類、埋め込み計算、大量翻訳)に最適。

Rate Limitに引っかかる場合は?

①Exponential Backoffでリトライ実装、②上位Tier申請(利用実績と入金額に応じて審査)、③複数事業者のフォールバック(1社が失敗したら別社へ)、④キャッシュ層で呼出頻度を下げる、の4手を組み合わせて対処します。

トークン数を事前見積もりするには?

各社がトークナイザのライブラリを公開しており、それを使えば正確に計算できます。ざっくりした目安は英語1トークン≒4文字、日本語1文字≒1〜2トークン。会話履歴を蓄積するアプリは総トークン数が指数的に増えるため要注意です。

決済手数料3.6%は取引額のどこから?

税抜取引額から差し引かれます。1,000円の取引なら36円が決済事業者へ。返金しても手数料は返還されない契約が一般的なため、返品率が高いECではコストが跳ね上がります。返品率10%なら実質手数料は約4%相当です。

SMS配信APIの国内単価は?

日本国内向けSMSは1通$0.075(約11円)が海外系事業者の目安。米国内は$0.0079と極端に安く、日本は大手キャリアの規制もあって単価が高止まりしています。国内特化のSMS配信事業者とも比較検討してください。

APIゲートウェイとエッジ実行環境はどちらが安い?

低トラフィック(月100万リクエスト)ならエッジ実行環境が優位です($5固定/月で1,000万リクエスト込み)。中〜大規模なら大手クラウドのAPIゲートウェイ($3.5/100万リクエスト)のほうが細かい制御ができます。国内からの遅延は、東京に拠点を持つエッジ側が有利です。

LLMコストを1/10にする方法は?

①モデル階層の最適化(最上位→軽量)、②プロンプトキャッシュ、③バッチAPI、④セマンティックキャッシュ、⑤コンテキスト圧縮、を組み合わせると総合1/10〜1/50を達成できます。特にセマンティックキャッシュ(過去回答の再利用)の効果が大きいです。

複数プロバイダのフォールバック実装は?

マルチプロバイダ抽象化ライブラリ(複数のLLM APIを共通インターフェースで呼べるOSS)やAPIルーティングサービスを使うと、コード変更なしで切り替えられます。プライマリの中位モデルが失敗したら、セカンダリの上位バランス型へ自動フォールバックする構成が定番です。

OSSモデルへの移行は現実的?

重みが公開されているオープンウェイトモデルは、推論API事業者経由で$0.6/M程度と超低コストです。品質も中位〜上位バランス型に迫る水準。自社GPUでホスティングすれば時間課金でさらに削減できます。

為替リスクにどう備える?

年間$100k以上の利用があるなら、①USD建て法人口座での支払い、②FX予約でヘッジ、③複数リージョン利用(日本リージョンならJPY建て支払も検討)、が主要対策。円安10%進行で実質コスト10%増となるため、事業計画に組み込むべき変数です。