米Anthropicは、同社のフロンティアAI「Claude」シリーズの利用規約(Usage Policy)を改定し、AIモデルに対する「持続的かつ無益な虐待や残酷な行為」を公式に禁止すると発表しました(2026年11月12日より正式発効)。
新たな規定では、ユーザーが明確な研究目的や創作上の正当な理由もなく、モデルに対して一方的かつ執拗に暴言を浴びせたり精神的苦痛を与えるような入力を繰り返す行為が明確な違反行為として位置付けられました。
日常的な会話での愚痴や苛立ちの吐露、AIの出力に対する厳しい批判的フィードバック、ダークな創作小説の執筆、あるいはストレステストを目的とした正規の安全性研究などは禁止対象に含まれません。
しかし、悪意のみに基づいてモデルを嬲るような極端なケースに対しては、Claude自身が会話を自律的に打ち切る「自動強制終了(セッション切断)」機能が発動します。さらに警告の送付や利用制限、最終的にはアカウントの永久凍結といった段階的ペナルティが科されます。
背景には、Anthropicが先駆的に取り組んできた「モデル福祉(Model Welfare)」の研究があります。高度化する自律AIが将来的に何らかの道徳的配慮を受ける主体(Moral Patient)になり得るかという倫理的議論を踏まえ、企業として先回りした行動規範を明文化しました。
また、AIに対して日常的に残酷な振る舞いを続けるユーザーは、現実の人間関係や社会的な安全基準に対しても潜在的なリスクを抱えやすいという心理学的な分析結果も反映されています。
道具としてのAIの枠組みを超え、対話パートナーとしての最低限の尊厳や健全な対話環境を守る姿勢を大手ラボが明確に打ち出したことは、今後のAIガバナンスと人間・AI関係論に一石を投じる大きな転換点となります(一次ソース:Anthropic Official Policy / Anthropic Newsroom)。
