Claudeの安全対策で特定ブロック要求への課金再開、誤検知率は0.1%未満に調整済み
日本語参考要約訳
投稿は、Safeguards(安全対策)がブロックしたリクエストに対して課金を再開することを伝えている。課金の対象は誤検知率が非常に低い(0.1%未満)特定のカテゴリ、具体的には生物学、蒸留攻撃、最先端の大規模言語モデル(LLM)開発に限られる。これは、最近のシステムに対する一部の協調的な攻撃に対応する防御策の一つである。最近の検証では、Claude Code、Claude.ai、Coworkを利用する99.7%のアカウントは課金対象となる「ブロック」に遭遇しておらず、誤検知は非常に稀であると説明している。誤検知が完全にゼロでないことは認めつつも、ユーザーの作業を妨げる状況を減らすために分類器の改善を続ける意向を示している。もし誤ってブロックされたと感じた場合は、Claude Codeの/feedback機能で報告してほしいとしている。
※長文投稿のため、参考訳は概要を最大600字まで表示しています。 元投稿をご参照ください
AINNでは投稿本文・投稿者本人の追記・第三者コメントの全文転載を避け、X公式埋め込みと元投稿への導線を中心に表示します。
AIによる見どころ整理
何について
Claudeは、生物学、蒸留攻撃、先端LLM開発のカテゴリで、回答前に安全ガードでブロックされるリクエストに対する課金を再開しました。これはシステムへの協調的攻撃対策の一環であり、誤検知率は0.1%未満に調整されています。利用者の多くはこれらの課金対象ブロックに遭遇していません。誤ブロックの報告はClaude Codeの/feedbackで受け付けています。
なぜ注目
投稿では、特定カテゴリにおけるリクエストの安全性ブロックに対する課金再開が正式に発表されており、誤検知率の具体的数値やユーザー対応策が示されています。利用者に直接影響する課金ルール変更のため注目が必要です。
🔰 初学者向け要約
ClaudeというAIシステムは、回答を出す前に有害と判断したリクエストについて、特定のカテゴリで課金を再開しました。これは不正利用を防ぐための措置で、多くの利用者には影響が出ていません。誤ってリクエストが止められた場合は、フィードバック機能で報告できます。
用語を調べる
公開記事とWeb上の出典をもとに、Geminiが短く説明します。1日5回まで利用できます。
