DeepSeekの値上げで優位性が消えました|GPT-5.6 Lunaへ移行した理由

DeepSeekは、性能に対して料金が極端に安いことが最大の魅力でした。多少の品質差があっても、コストで選ぶ理由がはっきりしていました。

しかし、2026年8月のAPI料金改定で、その前提が崩れました。DeepSeek V4
Flashは値上げされ、ピーク時間帯には入力$0.44、出力$1.32になります。一方、実務バッテリーでDeepSeek
V4 Flashを上回ったGPT-5.6 Lunaは、入力$0.20、出力$1.20です。

より高性能なモデルが、値上げ後のDeepSeekより安くなりました。これなら、メイン対話でDeepSeekを使い続ける理由はありません。

この記事では、Hermes
Agentの実際の利用ログ、API料金、12タスクの性能評価をもとに、DeepSeekからGPT-5.6
Lunaへ移行した判断をまとめます。Qwen Token
Planのクォータ切れによってDeepSeekへフォールバックしていた経緯も、補足として説明します。

結論:DeepSeekはメインモデルから外しました

今回の結論は明確です。

DeepSeekはオフピークのcron処理には残しますが、メイン対話のモデルからは外しました。値上げ後のDeepSeekには、品質と価格の両方でGPT-5.6
Lunaを選ぶ理由があります。

判断の根拠は3つです。

  • GPT-5.6 Lunaは同じ12タスクの実務バッテリーで100点相当でした
  • DeepSeek V4 Flashは87.5点でした
  • DeepSeekの新ピーク料金は、Lunaの入力料金より高く、出力料金もLunaを上回ります

モデル選びで重要なのは、過去の「最安」という印象ではありません。値上げ後の料金と、現在の実測性能を同じ表に置いて判断することです。

今回の構成は、最初は次のようになっていました。

model:
  default: qwen3.7-plus
  provider: custom:qwen-token-plan

fallback_providers:
  - model: deepseek-v4-flash
    provider: custom:deepseek

この設定だけを見ると、メインモデルはQwenです。しかし、Qwen Token
Planの7日間クォータを使い切ったあと、APIは429エラーを返しました。Hermes
Agentは設定されたフォールバック先へ切り替え、その後の対話ではDeepSeek V4
Flashが応答していました。

Qwenが動いていなかったのではありません。Qwenが動いていた期間と、DeepSeekへ切り替わった期間があったというのが正確な説明です。

DeepSeekの値上げでコスト優位性が消えました

2026年8月、DeepSeekはV4 FlashとV4
ProのAPI料金改定を発表しました。新料金は2026年8月16日16時(UTC)、日本時間では8月17日午前1時から適用されます。

これまでDeepSeekを選んでいた最大の理由は、性能と料金のバランスではなく、多少性能が落ちても圧倒的に安いことでした。今回の改定は、その選定理由を直接壊します。

料金は一律ではなく、ピーク時間とオフピーク時間に分かれます。

モデル現行入力現行出力新・オフピーク新・ピーク
DeepSeek V4 Flash$0.14$0.28$0.22 / $0.66$0.44 / $1.32
DeepSeek V4 Pro$0.435$0.87$0.66 / $1.98$1.32 / $3.96

表の「新・オフピーク」と「新・ピーク」は、入力/出力の料金です。キャッシュヒットの料金も改定され、V4
Flashではオフピークが$0.007、ピークが$0.014になります。

ピーク時間はUTCで01:00〜04:00、06:00〜10:00です。日本時間では、10:00〜13:00と15:00〜19:00がピーク時間にあたります。

手元の直近7日間の利用量を新料金で試算すると、DeepSeek利用分は次のようになります。

現行料金新・オフピーク中心新・ピーク中心
月換算約$17約$36約$72

DeepSeekが突然使えなくなるわけではありません。しかし、これまで「最安だから」という理由だけで選んでいたメイン対話については、状況が変わりました。ピーク時間帯のDeepSeekは、より高性能なGPT-5.6
Lunaより高くなります。

Qwen Token
Planは使い放題ではありません

次に、Qwen Token Planを確認しました。

Liteプランは月額$6の期間限定価格で、7日間の利用上限は2,500
Creditsです。5時間制限は期間限定で無制限になっていますが、7日間制限は残っています。

プラン月額7日間上限
Lite$62,500 Credits
Standard$1810,000 Credits
Pro$6840,000 Credits

ここで重要なのは、Token Planが完全な使い放題ではないことです。

  • 5時間制限は現在、期間限定で撤廃されています
  • 7日間クォータは残っています
  • 7日間の上限に達するとAPI呼び出しは停止します
  • クォータは最初の呼び出しから7日後にリセットされます
  • 未使用分は次の期間へ繰り越されません

実際にToken
PlanのAPIを直接呼び出すと、次の429エラーが返りました。

Your token-plan 1-week quota has been exhausted.
The quota will reset at 08-18 13:59:00 UTC.

日本時間では8月18日22時59分まで利用できない状態です。

コンソールの表示で「7 Days Usage
Limitが0」と表示されていても、消費量・残量・リセット時刻のどれを指しているのかを確認しないと、状態を誤認します。最終的には、APIを実際に呼び出してHTTPステータスとエラーメッセージを確認するのが確実です。

QwenがDeepSeekに変わった経緯

利用ログを時系列で確認すると、状況は次のようになっていました。

8月7日から8月12日まで

Qwen Token
Planのqwen3.7-plusが実際に動いていました。大きなWebUIセッションもQwenで処理されています。

8月12日夜

Liteプランの2,500 Creditsを使い切りました。この時点でToken
PlanのAPIはクォータ超過になりました。

8月13日以降

QwenのAPIが429を返すため、Hermes
Agentはフォールバック先のdeepseek-v4-flashへ切り替えました。

一方、wikiの自動保存などのcronジョブは、もともとdeepseek-v4-proを明示的に指定していました。こちらはQwenのクォータとは関係なく、最初からDeepSeekです。

つまり、実際の経路は次のように分かれていました。

経路実際のモデル
Qwenクォータが残っていた期間の対話Qwen 3.7 Plus
Qwenクォータ切れ後の対話DeepSeek V4 Flash
wiki-auto-saveなどのcronDeepSeek V4 Pro
Qwenの代替として後から設定した経路GPT-5.6 Luna

この確認で、「QwenのつもりがDeepSeekだった」という認識は半分正しく、半分誤りだとわかりました。Qwenは確かに動いていました。ただし、クォータ切れ後の自動切り替えを見落としていました。

フォールバックは便利ですが、料金と性能を変えます

フォールバックは、API障害やクォータ超過でサービスが止まるのを防ぐ重要な仕組みです。

一方で、次の問題があります。

  • モデル品質が変わる
  • 応答速度が変わる
  • 料金体系が変わる
  • 対応するAPI機能が変わる
  • ユーザーが切り替わりに気づかないことがある

特に危険なのは、設定上のモデル名と実際のモデル名が一致しなくなることです。

フォールバックは「動き続ける」という意味では成功しています。しかし、料金や品質まで含めて考えると、切り替わったことを通知する仕組みが必要です。

値上げ後のDeepSeekと代替モデルを同じテストで比較しました

DeepSeekを使い続ける理由があるか判断するため、これまで評価してきたモデルと新しい候補を比較しました。

同じ12タスクの実務バッテリーでは、次の結果でした。

モデル総合スコア入力/出力料金判定
GPT-5.6 Luna100点$0.20 / $1.20メイン候補
Qwen 3.7 Plus95.8点$0.32 / $1.28Token Planなら定額
Qwen 3.7 Flash91.7点$0.165 / $0.99条件付き候補
DeepSeek V4 Flash87.5点新OP $0.22 / $0.66オフピーク処理限定
Kimi K375.0点$3.00 / $15.00コード特化・高価
MiniMax M3参考68.5点$0.30 / $1.20性能差で不採用

GPT-5.6
Lunaは、計算、翻訳、要約、JSON生成、コード生成、コードレビュー、監視レポートなど12タスクを完走しました。JSON生成では実行日も正しく出力しました。

DeepSeek V4
Flashはコスト面で優れていますが、短文生成や推論トークンの消費によって、タスクによっては空応答や途中終了が起きました。総合性能ではGPT-5.6
Lunaが上回りました。

Kimi
K3も注目されているモデルですが、API料金は入力$3、出力$15です。性能は高いものの、DeepSeekの代替として「コスパ」を求める今回の条件には合いませんでした。

GPT-5.6
Lunaをメインに切り替えました

比較の結果、Hermes AgentのプライマリモデルをGPT-5.6
Lunaに変更しました。

現在の構成は次のとおりです。

model:
  default: gpt-5.6-luna
  provider: openai

fallback_providers:
  - model: deepseek-v4-flash
    provider: deepseek
  - model: claude-haiku-4-5
    provider: anthropic

GPT-5.6 Lunaをメインにした理由は3つあります。

1.
品質が実測で上回ったからです

同じ12タスクで、DeepSeek V4 Flashの87.5点に対し、GPT-5.6
Lunaは100点相当でした。モデルの評判ではなく、実際の用途に近いテストで比較しました。

2.
値上げ後のDeepSeekより安いからです

GPT-5.6 Lunaは入力$0.20、出力$1.20です。DeepSeek V4
Flashの新ピーク料金は入力$0.44、出力$1.32です。

オフピークのDeepSeekは入力$0.22、出力$0.66なので、単価だけならまだ安いです。しかし、Lunaは実測性能で上回っています。メイン対話のために時間帯を気にしながらDeepSeekを使うより、Lunaへ統一したほうが、品質・運用負荷・料金をまとめて管理できます。

3.
Qwenのクォータに依存しないからです

Qwen Token
Planは試用には向いていますが、Liteの7日間上限は今回の利用量では不足しました。クォータ超過時に別モデルへ切り替わる構成は便利ですが、主力モデルとしては状態を読みづらくなります。

cronはDeepSeekを残し、オフピークに寄せました

すべてをGPT-5.6 Lunaに変えたわけではありません。

wiki-auto-saveなどのcronは、処理時間と料金を管理しやすいようにDeepSeek
V4
Proを残しました。その代わり、DeepSeekのピーク時間を避けて実行するようにスケジュールを変更しました。

現在のwiki-auto-saveは次の時間です。

  • 6:00
  • 9:00
  • 14:00
  • 22:00

日本時間のピークである10:00〜13:00、15:00〜19:00を避けています。1時と19時の実行は必要なかったため削除しました。

ただし、ここにも注意点があります。Qwen Token
Planの個人向けプランは、公式規約上、バックグラウンドの定期処理や自動化API利用が禁止されています。cronをQwenへ移すのは、料金だけを見れば魅力的でも、アカウント停止リスクがあります。

サブスクリプションの安さだけでcronの移行先を決めてはいけません。利用規約まで含めて判断する必要があります。

今回の教訓です

今回の一連の見直しで、AIモデル選びについていくつかの教訓が得られました。

設定ファイルを見ただけでは不十分です

default: qwen3.7-plusと書いてあっても、APIクォータ超過時には別モデルが応答している可能性があります。セッションログ、プロバイダー名、実際のAPI応答を確認する必要があります。

「最安モデル」は時間帯と条件で変わります

DeepSeekは改定後もオフピークなら安価です。しかしピーク料金、キャッシュヒット率、推論トークン、バッチ割引を含めると、単純な入力単価だけでは比較できません。

サブスクは無制限ではありません

Qwen Token Plan Liteは月額$6ですが、7日間2,500
Creditsの上限があります。利用量が多い場合は、安いプランを選ぶことが必ずしも得ではありません。

コストと品質は同じテストで比較します

ベンチマークの数字だけでは、実際の対話やコードレビューで使えるか判断できません。計算、要約、JSON、コード、監視レポートなど、普段の作業に近いタスクを同じ条件で試す必要があります。

まとめ:DeepSeekの安さが消えたなら、メインモデルを見直します

今回の構成では、GPT-5.6
Lunaをメインモデルにし、DeepSeekをフォールバックとcronに残しました。

DeepSeekを完全に捨てたわけではありません。オフピークに固定できるcronの大量処理では、まだコストメリットが残っています。

ただし、メイン対話でDeepSeekを使い続ける理由はなくなりました。値上げ後のピーク料金はLunaより高く、オフピーク料金で運用するには時間帯の制約があります。そこまでして、実測性能で下回るDeepSeekをメインに残す必要はありません。

DeepSeekの優位性は「安さ」でした。その安さが失われたなら、より高性能で運用しやすいGPT-5.6
Lunaを選ぶのが自然です。

AIモデルを選ぶときは、料金表だけでなく次の順番で確認するのが安全です。

  1. 実際に使うタスクで性能を測ります
  2. 入力・出力・キャッシュ・推論トークンを確認します
  3. クォータと利用規約を確認します
  4. フォールバック先と切り替え条件を確認します
  5. 実際のログで、想定したモデルが動いているか確認します

モデル選びで本当に見るべきなのは、設定画面に表示された名前ではなく、実際にどのAPIへリクエストが流れ、いくら請求され、どの品質で返ってきたかです。

参考リンク