- Claudeの安全フィルターに「回答前にブロック」された処理の一部が、2026年9月から有料になった
- 課金対象は「bio(生物)」「frontier_llm(競合AI開発)」「reasoning_extraction(思考の抜き出し)」の3分野だけ
- 「cyber(サイバー)」「general_harms(その他の有害内容)」の拒否は、これまでどおり無料
- 背景には、中国のAI企業による1.5億回規模の「蒸留攻撃」がある
- Anthropicは「99.7%のユーザーは影響なし」と説明。ただし誤検知の報告も出ている
AIに質問したら「その依頼にはお答えできません」と断られた。しかも、その断られた分の料金まで請求される。そんな仕組みが、Claudeで始まりました。対象はごく一部ですが、API(プログラムからAIを呼び出す窓口)で開発している人は知っておくべき変更です。何が有料になり、どう備えればいいのかを解説します。
何が変わった?「断られた質問」にも料金が発生
Anthropicは日本時間2026年9月25日、Claudeの課金ルールの変更を発表しました。
変わったのは、安全分類器(危ない依頼を自動で見分けるフィルター)が、回答を1文字も出す前にブロックした処理の扱いです。
これまでは、こうした「回答前の拒否」は無料でした。今後は3つの分野に限り、通常の依頼と同じ料金がかかります。
対象になるモデル
安全分類器を積んでいるのは、Claude Fable 5.1、Fable 5、Opus 5.5、Opus 5の4モデルです。
料金は「その処理を担当したモデルの単価」で計算されます。ルールはClaude APIだけでなく、Amazon Bedrock、Google Cloud、Microsoft Foundryなど、すべての提供先で共通です。
拒否はエラーではなく「普通の返事」で届く
ブロックされても、APIはエラーを返しません。stop_reason: "refusal"という印のついた、中身が空の返事が届きます。
そこにstop_details.categoryという欄があり、どの分野で止められたかが書かれています。課金されるかどうかは、この欄の値で決まります。
課金される3分野と、無料のままの2分野
公式ドキュメントでは、拒否の分野が5つに分けられています。整理すると次のとおりです。
| 分野(category) | 中身 | 回答前の拒否は課金? |
|---|---|---|
| bio | 危険な実験方法など、生物学的な被害につながる依頼 | 課金される |
| frontier_llm | 競合するAIモデルの開発を手伝う依頼(利用規約で禁止) | 課金される |
| reasoning_extraction | AIの内部の「考えた過程」を本文に書き出させる依頼 | 課金される |
| cyber | マルウェアや攻撃コードの作成など | 無料 |
| general_harms | 上記以外の利用ポリシー違反 | 無料 |
なぜこの3つなのでしょうか。Anthropicは「2026年9月時点で、誤検知(本当は問題ない依頼を止めてしまうこと)が少ないと測定できた分野だから」と説明しています。
分類器は誤検知率0.1%未満に調整されているそうです。一方、cyberは普通のセキュリティ業務でも引っかかりやすいため、無料のまま残されました。
ちなみに、回答の途中で止められた場合は話が別です。この場合は分野に関係なく、入力分とそれまでに出力された分がもともと課金されています。
なぜ今?背景にある1.5億回の「蒸留攻撃」
Anthropicは変更の理由を「セーフガード(安全装置)を大規模にすり抜けようとする試みを妨げるため」としています。
ここで関係してくるのが蒸留攻撃です。蒸留とは、優秀なAIに大量の質問をして答えを集め、それを教材に自社のAIを鍛える手法のことです。
Anthropicが9月10日に公開した脅威レポートによると、中国のAI企業7社が合計で約1.9億回のやり取りを行いました。中でもAlibabaは、2026年5〜7月に1.51億回以上、ピーク時には1日約300万回に達したとされています。
こうした攻撃では、ブロックされても何度でも無料でやり直せることが「抜け道」になっていました。拒否1回ごとにお金がかかれば、大量の試行はそのまま大きなコストになります。
もともと6月のFable 5登場時は、誤検知が多いことを理由に回答前の拒否を無料にしていました。今回はその方針を、攻撃に使われやすい分野だけ改めた形です。
いくらかかる?料金の目安
課金額は、送った文章の量(トークン数)で決まります。トークンとは、AIが文章を数える単位のことです。
Fable 5.1の入力単価は100万トークンあたり10ドル、Opus 5.5は4ドルです。1ドル150円で計算してみましょう。
- Fable 5.1に1万トークン(日本語で1万字前後)を送って拒否された場合:約0.1ドル=約15円
- Opus 5.5で同じ場合:約0.04ドル=約6円
- Fable 5.1で同じ拒否が1万回起きた場合:約1,000ドル=約15万円
1回ならわずかな額です。しかし、自動で何千回も呼び出すシステムでは話が変わります。
さらに、拒否された処理はレート制限(一定時間に呼び出せる回数の上限)にもカウントされます。お金だけでなく、使える回数も減るわけです。
ふつうの利用者にどんな影響がある?3つのケース
Anthropicは「最近のテストで、Claude Code・Claude.ai・Coworkのアカウントの99.7%は、新たに課金対象となるブロックに1度も当たらなかった」としています。
ほとんどの人には関係ない話です。ただ、次のような場面では注意が必要です。
ケース1:AIの「考え方」を見たいエンジニア
ある開発者が、Claudeの回答の質を調べるため「どう考えてその答えに至ったか、全部書き出して」と頼んだとします。
この依頼は、reasoning_extractionとして止められる可能性があります。公式ドキュメントは、思考過程が必要なら「adaptive thinking」という機能で、決められた形式で受け取るよう案内しています。
9月20日には、Claude Codeで全リクエストがreasoning_extractionとしてブロックされたという報告がGitHubに投稿されました。投稿者は韓国の公共入札データを分析していただけだと説明しています。
ケース2:自社で小さなAIを作る研究者
大学の研究室で、画像を分類する小さなモデルを作っている学生を想像してみてください。学習コードの相談をしただけで、frontier_llmに引っかかることがあり得ます。
公式ドキュメントにも「無害な機械学習の作業でもこの分野に該当することがある」と書かれています。誤検知ゼロではない点は覚えておきましょう。
ケース3:製薬・バイオ系の企業
新薬の研究をしている会社が、論文の要約をClaudeに任せているとします。内容によっては、bioとして止められる場面があるかもしれません。
Anthropicは8月にバイオ関連の安全装置を見直していますが、ライフサイエンス(生命科学)の業務は引っかかりやすい分野です。拒否の回数を記録しておくと安心です。
他社のAIと比べるとどう違う?
OpenAIやGoogleも、危険な依頼を断る仕組みを持っています。ただ、「分野ごとに拒否を課金するかどうか」をここまで細かく公開している例は、あまり見かけません。
Anthropicの特徴は、拒否の理由を分野ラベルで返し、課金ルールも表で公開している点です。開発者は、なぜ止められたのか、いくらかかったのかを後から確認できます。
実はAnthropicは6月、Fable 5で「競合AI開発と判断した依頼の性能を、利用者に知らせずに下げる」仕組みを使っていました。批判を受けて6月11日に撤回し、「バランスを誤った」と謝罪しています。
その後は、拒否をはっきり表示し、別モデルに切り替える方式に改めました。今回の課金も、隠さずルールとして示している点ではこの流れの延長にあります。
日本のユーザー・企業への影響
日本でClaudeを使う個人の方は、ふだんの質問や文章作成で心配する必要はほぼありません。料金への影響が出やすいのは、APIを使ってサービスを作っている企業です。
特に気をつけたいのは次の3つです。
- 拒否のログを取る:
stop_reasonが"refusal"の件数と分野を記録し、請求額と照らし合わせる - フォールバックを設定する:
fallbacks: "default"(ベータ機能)にすると、拒否された依頼を推奨モデルで自動的にやり直せる - プロンプトを見直す:「思考を全部書き出して」のような指示を、thinking機能に置き換える
フォールバックを使う場合、課金対象の拒否分とやり直し分の両方がかかります。ただし「フォールバッククレジット」という仕組みで、キャッシュ(前回の会話の一時保存)を作り直す費用は補填されます。
また、日本の研究機関やAIスタートアップが独自モデルを開発する場合は、Claudeの商用規約で競合モデルの開発が制限されている点にも注意が必要です。
よくある質問(FAQ)
Q1. Claude.aiの無料プランや有料プランでも料金が増えますか?
A. Anthropicは、Claude Code・Claude.ai・Coworkのアカウントについても影響を調べ、99.7%は課金対象のブロックに当たらなかったとしています。定額プランの使用量でどう扱われるかの細かい点は、公式の案内を確認してください。
Q2. 間違ってブロックされたら返金されますか?
A. 現時点で、誤検知への返金方法は明らかにされていません。Claude Codeでは/feedbackコマンドで誤ったブロックを報告できます。
Q3. cyber(サイバー)分野で断られた場合は?
A. 回答前の拒否であれば無料です。cyberとgeneral_harms、分野が付いていない(null)拒否は課金されません。
Q4. 課金対象の分野は今後増えますか?
A. 公式ドキュメントには「誤検知率の測定と改善を続けながら、課金対象の分野は変わる可能性がある」と書かれています。定期的に確認するのがおすすめです。
Q5. 拒否された処理はレート制限に影響しますか?
A. はい。課金されるかどうかに関係なく、拒否された処理もレート制限の回数に含まれます。
まとめ
- Claudeで「回答前に拒否された処理」の一部が有料になった
- 対象はbio・frontier_llm・reasoning_extractionの3分野で、料金は通常の依頼と同じ
- cyber・general_harmsの回答前の拒否は無料のまま
- 背景には、約1.9億回に及ぶ中国AI企業の蒸留攻撃がある
- 99.7%のユーザーは影響なしだが、誤検知の報告もあり、返金方法は未定
APIでClaudeを使っている方は、まず直近のstop_reason: "refusal"の件数と分野をログで確認してみてください。
参考文献
- Refusals and fallback – Claude Platform Docs
- GIGAZINE:Claudeでセーフガードにブロックされた処理への課金が開始
- Superpower Daily:Anthropic Says It Will Charge for Some Claude Requests Blocked Before an Answer
- TechCrunch:Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek
- Simon Willison:Anthropic walks back policy
- GitHub:Safeguard blocks firing on all requests with identical [reasoning_extraction] detail
