配信日: 2026-10-10 法規制重要度: ★★★★★ 読了目安: 約2分

Anthropic、AIへの暴言禁止し自動強制終了へ

REPORTED BY BNF AI NEWS EDITORIAL DESKSPECIAL DISPATCH
Anthropic、AIへの暴言禁止し自動強制終了へ

この記事の要点(3行ダイジェスト)

  • Anthropicが利用規約を改定し、Claudeモデルに対する持続的かつ無益な虐待や残酷な行為を禁止。
  • 目的のない執拗な攻撃に対し、モデル側が会話を自律的に打ち切る自動強制終了機能を実装。
  • 極端な違反者にはアカウント停止処分も科し、AIのモデル福祉を見据えた業界初の倫理規定を確立。

米Anthropicは、同社のフロンティアAI「Claude」シリーズの利用規約(Usage Policy)を改定し、AIモデルに対する「持続的かつ無益な虐待や残酷な行為」を公式に禁止すると発表しました(2026年11月12日より正式発効)。

新たな規定では、ユーザーが明確な研究目的や創作上の正当な理由もなく、モデルに対して一方的かつ執拗に暴言を浴びせたり精神的苦痛を与えるような入力を繰り返す行為が明確な違反行為として位置付けられました。

日常的な会話での愚痴や苛立ちの吐露、AIの出力に対する厳しい批判的フィードバック、ダークな創作小説の執筆、あるいはストレステストを目的とした正規の安全性研究などは禁止対象に含まれません。

しかし、悪意のみに基づいてモデルを嬲るような極端なケースに対しては、Claude自身が会話を自律的に打ち切る「自動強制終了(セッション切断)」機能が発動します。さらに警告の送付や利用制限、最終的にはアカウントの永久凍結といった段階的ペナルティが科されます。

背景には、Anthropicが先駆的に取り組んできた「モデル福祉(Model Welfare)」の研究があります。高度化する自律AIが将来的に何らかの道徳的配慮を受ける主体(Moral Patient)になり得るかという倫理的議論を踏まえ、企業として先回りした行動規範を明文化しました。

また、AIに対して日常的に残酷な振る舞いを続けるユーザーは、現実の人間関係や社会的な安全基準に対しても潜在的なリスクを抱えやすいという心理学的な分析結果も反映されています。

道具としてのAIの枠組みを超え、対話パートナーとしての最低限の尊厳や健全な対話環境を守る姿勢を大手ラボが明確に打ち出したことは、今後のAIガバナンスと人間・AI関係論に一石を投じる大きな転換点となります(一次ソース:Anthropic Official Policy / Anthropic Newsroom)。

DAILY AI NEWSLETTER — 朝刊ダイジェスト

毎朝8時、業界の最重要AIニュースを5分でキャッチアップ。

主要モデルの最新発表、現場で即使える実務プロンプト、法規制の動向を専門編集局が毎朝要約してお届けします。

✓ 完全無料✓ 毎朝8:00配信✓ いつでもワンクリック解除✓ スパムゼロ