非公式・AI自動要約ニュースサイト(各AI企業の公式とは無関係)
AI News JP / www.ai-news.jp
📰 ニュース DeepSeek 🟠 重要 LLMコーディング · 出典: DeepSeek Release Notes

KVキャッシュ 1/8 削減、エージェント実行コスト直撃。V4-Pro は廃止移行。

DeepSeek、V4.1-Flashでコスト・性能を大幅改善、V4-Pro廃止へ

原題: DeepSeek-V4.1-Flash: Smarter, Faster, More Efficient | DeepSeek API Docs

重要度の根拠: 本番 API の強制ルーティング変更とコスト構造大幅改善で、既存 DeepSeek ユーザーに即座に影響

要約

DeepSeekが新モデル「V4.1-Flash」を発表しました。552Bパラメータの混合専門家モデル(MoE)で、新しいエンコーダ・デコーダアーキテクチャにより入力時8B、出力時16Bのアクティブパラメータのみを使用します。前世代比でKVキャッシュ(推論の中間結果保存領域)をSSD容量で1/8に削減でき、エージェント実行コストを大幅削減します。複数団体の評価でV4.1-FlashはV4-Proを性能・コスト・速度の全項目で上回り、9月14日からV4-Pro呼び出しはV4.1-Flash料金で自動ルーティングされます。WorkBuddyやOpenCodeなどのパートナーが既にサポートを開始しています。

要点

  • KVキャッシュ 1/8 削減、エージェントコスト大幅低減
  • V4-Pro 廃止、V4.1-Flash へ自動ルーティング開始
  • ベンチマークで V4-Pro 性能を超越
  • 8B/16B アクティブパラメータ設計で推論高速化
  • WorkBuddy / OpenCode など主要パートナーが対応済み
開発者向け技術解説(API・実装詳細・破壊的変更)を見る

DeepSeek V4.1-Flashの技術仕様:552Bパラメータ MoE、新型 Causal Encoder–Decoder アーキテクチャで入力8B・出力16Bの動的パラメータ配置。KV キャッシュは前世代比 1/8 に圧縮(SSD ストレージ削減)。ベンチマークで V4-Pro 超越。API 側は `deepseek-flash` モデル名に設定。後方互換性のため `deepseek-v4-flash` / `deepseek-v4-flash-vision-exp` は一時的に V4.1-Flash にルーティング。9月14日 UTC 04:00 時点で全 `deepseek-v4-pro` リクエストが V4.1-Flash 価格でルーティングされ、V4.1-Pro 正式リリースまで継続。エージェント実行時のキャッシュヒット課金削減が主なコスト低減メリット。

本文の日本語訳(全文)を見る

🚀 DeepSeek-V4.1-Flash を発表:より賢く、より高速、より効率的。

🔹 新しいアーキテクチャファミリーの最小モデルで、ネイティブな視覚理解を備えています。

🔹 より大きな機能、より高速な推論、より高いスループット、および大規模モデルへのスケーリングに向けて設計されています。

🔹 552B パラメータの MoE(混合専門家モデル)。

🔹 新しい Causal Encoder–Decoder アーキテクチャ:入力では 8B、出力では 16B のアクティブパラメータのみ。

🔹 新しい事前学習方法と大規模 RL(強化学習)後学習により、DeepSeek-V4-Pro を含むフラッグシップモデルを上回るベンチマーク結果を達成。

前世代比較では、V4.1-Flash の KV キャッシュ必要容量は以下のとおり:

🔹 SSD ストレージの 1/8

キャッシュヒット課金はエージェントコストの大きな部分を占めることが多いです。キャッシュを圧縮することで、これらのコストを大幅に削減できます。

モデルを deepseek-flash に設定してください。

🔹 V4-Flash と V4-Flash-Vision-Exp は廃止されました。互換性のため、deepseek-v4-flash と deepseek-v4-flash-vision-exp は一時的に V4.1-Flash にルーティングされます。

🔹 複数の団体による試験により、V4.1-Flash は性能、コスト、速度および総実行時間の全項目で V4-Pro を上回りました。V4-Pro を段階的に廃止しています。

🔹 2026 年 9 月 14 日の UTC 04:00 から、すべての deepseek-v4-pro リクエストは V4.1-Flash レートで V4.1-Flash にルーティングされます。これは V4.1-Pro がリリースされるまで継続します。

🤝 公式パートナーである WorkBuddy(CodeBuddy を含む)および OpenCode は現在 V4.1-Flash を完全にサポートしています。今すぐお試しください!

モデルAPI/SDKパフォーマンス対象: 開発者対象: 企業導入担当

出典: https://api-docs.deepseek.com/news/news260910

媒体: DeepSeek Release Notes

※本記事は Anthropic / OpenAI / Google / Meta / Mistral / DeepSeek / Sakana 等各社の公開情報を基に AI (OpenAI GPT-4o-mini) が日本語で要約・分類した二次的著作物です。著作権法第32条の引用要件に基づき出典 URL を必ず併記しています。要約は AI 生成のため誤訳・誤解釈を含む可能性があります。詳細・正確な情報は必ず出典元の原文をご確認ください。