Qwen3.8-Omni-Flashが公開|音声入力のAPI料金が前世代比98%減

画像の出典:Qwen公式X
業務効率化を推進するDX担当者にとって、AIモデルのコストとマルチモーダル(複数形式のデータ処理)性能のバランスは、導入の成否を分ける重要な判断基準です。Alibaba CloudのQwenチームは現地時間の2026年9月18日、テキスト、画像、音声、動画をネイティブに処理するオムニモーダルモデル「Qwen3.8-Omni-Flash」を発表しました。
本記事では、同モデルの性能と、大幅なコスト削減を実現したAPI料金体系について詳しく解説します。
高度なマルチモーダル処理とタスク実行能力
映像と音声を統合的に理解する新モデル
Qwen3.8-Omni-Flashは、単なる情報の読み取りにとどまらず、タスクの計画立案や外部ツールの呼び出し、制作物の生成までを一貫して行えるよう設計されています。100万トークンという大規模なコンテキスト(文脈)に対応しており、長時間の動画編集や複雑な議事録の要約など、ビジネス現場での実用性を重視したモデルです。なお、リアルタイムの音声・映像対話は別モデルとして公開されています。Alibaba Cloud Model Studioのモデル一覧は、2026年9月21日時点ではリアルタイム対話に qwen3.5-omni-plus-realtime を案内していましたが、9月22日に専用の qwen3.8-omni-flash-realtime が加わり、現在は「音声・映像の解析とテキスト生成には qwen3.8-omni-flash を、リアルタイムの音声・映像対話には qwen3.8-omni-flash-realtime を使う」と案内しています(提供地域は中国・北京とシンガポール)。本記事で挙げる料金は qwen3.8-omni-flash のものです。
ベンチマークではGemini 3.8 Flashに迫る
性能面では、音声と映像を組み合わせた処理でGemini 3.8 Flashに近い水準に達し、音声単体の総合的な処理能力ではGemini 3.8 Flashを上回ったとしています。前世代のQwen3.5-Omni-Plusとの比較では、29項目の評価の平均スコアが25%以上向上しました。音声・映像を扱うエージェント向けのベンチマークでは、WildClawBench-MMで36.5ポイント、AgenticVBenchで22.3ポイントの改善があり、UniClawBenchでは69.6を記録しています。なお、これらはいずれもAlibaba Cloud自身が公表した数値です。
実行環境の提供とAPIによる利用
今回の発表では、モデル本体の重みは公開されておらず、Alibaba Cloud Model Studio経由のAPI提供が中心です。あわせて、音声や動画を扱う拡張機能「Qwen-MM-Plugins」が公開されました。動画から手順や要点を抜き出してPDFの資料にまとめる「Video2Note」などが含まれます。もう一つのランタイム(実行環境)「Qwen-Live Harness」については、公式ブログが公開済みと書いている一方、同じ日の公式Xの投稿では「近日公開」とされています。編集部が2026年9月21日に確認したところ、公式ブログが案内している公開先のページは表示できませんでした。利用を見込む場合は、公開状況を確かめてから計画に入れてください。
API料金の刷新とコスト構造の比較
前世代比で最大98%超のコスト削減
今回のアップデートで特筆すべきは、API利用料金の大幅な引き下げです。前世代のQwen3.5-Omni-Plusと比較して、音声入力の料金は1時間あたり98%以上、音声・動画入力の料金は1時間あたり93%以上の引き下げが実現されました。これにより、これまでコスト面で導入をためらっていた動画解析や音声の書き起こし・要約といった業務プロセスにも、AIエージェントを組み込みやすくなります。
リージョンごとに異なる価格
Alibaba Cloud Model StudioにおけるQwen3.8-Omni-Flashの価格は、リージョンによって異なります。国際リージョンでは、入力が100万トークンあたり0.15ドル、キャッシュヒット時の入力が0.016ドル、出力が0.47ドルです。日本(東京)リージョンでは、入力が0.113ドル、キャッシュヒット時入力が0.014ドル、出力が0.382ドルと、より安価に設定されています。
Gemini 3.8 Flashとの比較は導入価格が前提
なお、比較対象として挙げられるGemini 3.8 FlashのAPI価格は、2026年12月31日までの導入価格として入力0.75ドル/出力3.75ドルで提供されていますが、2027年1月1日以降は入力1.5ドル/出力7.5ドルへと引き上げられる予定です。この導入価格と比べると、入力単価は国際リージョンで約5分の1、東京リージョンで約7分の1です。出力単価ではそれぞれ約8分の1、約10分の1になります。
業務への適用と今後の展望
解析とタスク遂行の融合
Qwen3.8-Omni-Flashは、単に情報を理解するだけでなく、自律的にタスクを完遂する「エージェント」としての活用が期待されています。Alibaba Cloudが挙げている使い方は、動画編集、翻訳、映像の解説、音声と映像の要約です。会議については、内容を理解して後続の作業につなげる例と、動画から手順や要点を抜き出してPDFの資料に整える「Video2Note」というプラグインが示されています。
導入に向けた検討のポイント
企業が本モデルを導入する際は、自社の業務プロセスにおいて「どの程度のコンテキスト長が必要か」「音声・動画の解析がどの程度業務効率に寄与するか」を精査することが重要です。料金表には東京リージョンが載っているため、国内から使う場合の単価は事前に確認できます。ただし、データの取り扱いが自社の基準を満たすかどうかは、Alibaba Cloud側の規約を個別に確認する必要があります。
まとめ
- Qwen3.8-Omni-Flashは、テキスト・画像・音声・動画を扱うオムニモーダルモデルで、100万トークンに対応。
- 音声・映像処理性能はGemini 3.8 Flashに近く、音声単体では同モデルを上回る性能を記録。
- 前世代比で音声入力料金を98%超、音声・動画入力料金を93%超引き下げ。
- 日本(東京)リージョンのAPI価格は、入力0.113ドル、出力0.382ドル(100万トークンあたり)。
- モデル本体は非公開でAPI提供が中心。拡張機能「Qwen-MM-Plugins」は公開済みだが、ランタイム「Qwen-Live Harness」は公開先を確認できなかった。
💡 編集部の見解
Alibaba Cloudが音声・動画・テキストを扱う新モデル「Qwen3.8-Omni-Flash」を公開しました。100万トークンに対応し、音声入力のAPI料金を前世代比で98%超引き下げています。
- 東京リージョンの単価:入力は100万トークンあたり0.113ドルで、Gemini 3.8 Flashの0.75ドルの約7分の1です。ただし0.75ドルは2026年末までの導入価格で、2027年1月に1.5ドルへ上がります。
- 提供はAPIのみ:モデルの重みは公開されません。自社サーバーで動かしたい企業には向かず、クラウド経由で使う前提の選択肢です。
出典:Alibaba Cloud/Qwen(Alibaba Cloud)/Qwen公式X




