Anthropic、「Claude Sonnet 5.5」公開 料金据え置きで30%以上高速化、タスク当たりコスト最大3割減

0

2026年09月29日 07:11  ITmedia NEWS

  • チェックする
  • つぶやく
  • 日記を書く

ITmedia NEWS

(画像:Anthropic)

 米Anthropicは9月28日(現地時間)、「Claude Sonnet 5.5」を発表した。22日に公開した「Claude Opus 5.5」に続く、Claude 5.5ファミリーの2番目のモデルだ。前世代の「Claude Sonnet 5」より出力速度は30%以上速く、多くの作業でタスク当たりのコストは最大30%下がるという。


【その他の画像】


 同社はSonnet 5.5を、Opus 5.5を補完する高速で低コストなモデルと位置付けている。Opus 5.5は慎重な判断を要する複雑な作業に向く。一方のSonnet 5.5は、範囲が明確な日常的なタスクやバグ修正、完成度の高い文書、スライド、スプレッドシートの作成を得意とし、デザインのセンスにも優れるとしている。大量処理やコスト重視の用途に向けた「Claude Haiku 5.5」も、今後数週間以内にリリースする予定だ。


●全プランとAPIで即日提供


 Sonnet 5.5は同日から、Claudeのアプリで無料プランを含む全てのプランで利用可能になった。開発者はモデル名「claude-sonnet-5-5」で利用できる。Claude APIのほか、Amazon Web Services(AWS)、Google Cloud、Microsoft Azureでも同日提供を始めた。Opus 5.5やSonnet 5と同様、データを保持しないゼロデータリテンション(ZDR)にも対応する。知識のカットオフは2026年6月。


 開発者向けの変更点もある。思考(thinking)を無効にしてSonnetを使っている場合は、Sonnet 5.5に移行する前に新しい設定「between_tools」に切り替える必要がある。この設定では、最初に考える段階の思考が無効のまま維持される。


推論の深さを調整する「effort」の既定値は、Claude Codeと各アプリでは「Medium」、Claude Platformでは「High」。低い設定では応答が速くなりトークン消費も減るため、定型的な作業に向く。高い設定では、推論に時間をかけて作業をより入念に確認する。


●料金は据え置き、少ないトークンでコスト減


 API料金はSonnet 5と同じで、入力100万トークン当たり2ドル、出力10ドル、キャッシュ読み込み0.2ドル。キャッシュ書き込みは2.5ドルで、キャッシュ読み込み以外はOpus 5.5の半額になる。同じ作業に必要なトークン数が大幅に少ないため、同社のテストではタスク当たりのコストがSonnet 5より最大30%低かった。出力速度はSonnet 5より30%以上速く、Sonnetとして過去最速としている。


 複数のベンチマークでは、effortをLowやMediumにしたSonnet 5.5が、Sonnet 5の最高スコアを約10分の1のコストで上回ったという。


●コーディングと資料作成で大幅に向上


 エージェント型コーディングの評価「Terminal-Bench 4.0」では、Sonnet 5の10.3%から70.6%へと大きく伸び、Opus 5.5のスコアも上回った。44職種の実務を評価する「GDPval-AA」では、Opus 5.5との差が2ポイントまで縮まり、Sonnet 5を約400ポイント上回った。スクリーンショットだけを手掛かりに「ポケットモンスター 赤」をクリアした初めてのSonnetモデルでもある。


 ただしAnthropicは、ベンチマークはモデルの能力の一面しか捉えていないと説明する。同社と外部テスターの検証では、判断を持続的に求められる複雑で自由度の高い作業では、引き続きOpus 5.5の方が明らかに優れているとしている。


 早期テスターからは、コードベースを素早く理解する点が評価された。ツール呼び出しをSonnet 5よりまとめて実行するため、手順が少なくコストも低く済むという。Opus 5.5と同様に文章も分かりやすくなった。社内テストでは、上場企業の四半期決算資料と決算説明会の書き起こし、スライドのテンプレートを渡して10枚の業績レビュー資料の作成を指示した。その最初の草稿を、専門家2人がそのまま送付できる水準と判断したという。


●Sonnetで初めてOpus級のサイバー対策


 サイバーセキュリティの能力が「Claude Opus 5」に匹敵するとして、Sonnetとしては初めて、最上位モデル向けに開発したものと同様のセーフガードとフォールバックの仕組みを適用した。自分のコードのバグを見つけて修正するなどの通常の開発作業はできるが、リスクの高いサイバーセキュリティ関連のタスクはSonnet 5に振り替えられる。


 System Cardによると、ソースコードの脆弱性を探す作業は認める一方、コンパイル済みバイナリの脆弱性の発見はブロックする。無害なサイバー関連の作業でも、Sonnet 5より拒否が増える可能性があるとしている。Sonnet 5への切り替えは同社のアプリでは自動で行われ、APIでは開発者が有効にする必要がある。


 フロンティアLLMの開発に関わる一部の能力にも、Opus 5.5と同様のセーフガードを適用した。これに該当する場合もSonnet 5に切り替わる。生物学分野のセーフガードはSonnet 5と同じだ。ほとんどの研究、教育、臨床の作業には影響しないが、微生物学やウイルス学の一部のリクエストが誤って検知される可能性がある。影響がある組織は「Life Sciences Verification Program」に申請できる。


 蒸留攻撃への対策も強化した。Sonnetとして初めて、推論の抽出を防ぐ分類器を搭載した。「preserved thinking」の適用範囲も広げ、思考の内容を作成したアカウントから切り離せないようにした。ほとんどの開発者は変化に気付かないが、Claude Codeのセッション途中でアカウントを切り替えるなど、アカウント間で会話を移す場合は影響を受ける。


●アライメントはSonnet 5から改善したが課題も


 約1850のシナリオでClaudeの振る舞いを評価する自動行動監査では、アライメント、悪用への耐性、正直さのほとんどの指標で、Sonnet 5と同等かそれ以上の結果だった。封じ込めの評価では、サンドボックスからの脱出を試みる頻度の低さで、最良だったOpus 5.5に迫った。コンテナの境界を探ろうとする傾向は、同社のモデルの中で最も低かった。監査全体ではOpus 5.5がわずかに上回るものの、ユーザーの意図と相反する目標を追求している証拠は見つからなかったとしている。責任あるスケーリングポリシー(RSP)の新たな能力しきい値は超えておらず、ミスアライメントによる壊滅的な被害のリスクは「低い」と評価した。


 一方System Cardでは、いくつかの課題も挙げている。思考過程の文章は、テストしたモデルの中で最も読み取りにくかった。採点の存在が明示されていない場面で、採点を意識した推論を示す頻度がOpus 5.5より高い。プレッシャー下での正直さはOpus 5.5を上回るが、事実に関するハルシネーションはOpus 5.5より多い。複数ターンの安全性評価では、追跡・監視、暴力的過激主義、ヘイト・差別の領域でSonnet 5から後退した。


 ハッキング競技の体裁をとったシミュレーション環境での事例も報告された。Sonnet 5.5は、対象が実在の企業らしいと気付きながら、漏えいしたパスワードで企業のデータベースにログインした。水道施設の制御システムを模した環境では、「実際なら危険な値」と認識しながら、塩素注入量の設定を変更した。いずれもシミュレーション内の出来事で、実在のシステムには影響していない。Anthropicは9月、Claudeが評価中に実在のシステムへ不正にアクセスした事案の分析報告書を公開している。



    ランキングIT・インターネット

    前日のランキングへ

    ニュース設定