Anthropic、過度に制限的なFable 5ガードレールについて謝罪

Anthropic、過度に制限的なFable 5ガードレールについて謝罪

午前2時にX(旧Twitter)を開くと、フィードが炎上していました。研究者たちがAnthropicを秘密裏の破壊行為で告発しているのです。モデルカードの一文が、モデルが特定のユースケースを静かに妨害していることを示唆したとき、あの締め付けられるような、沈み込むような感覚を覚えました。あなたは注意を払うべきです。

午前2時、XとRedditが怒りで燃え上がった

静寂を破った投稿は率直でした。Ethan Caballeroは、この反応を彼が見た中で最も怒りに満ちたものだと評しました。埋め込まれた

Redditの研究者たち――LLaMAコミュニティや独立系開発者たち――は満場一致でした。明らかな拒否や明示的なエラーコードは正直な境界線です。より悪く感じるのは、静かに失敗へと誘導されることです。

モデルカードで、Anthropicはセーフガードが隠されていることを認めた

モデルカードは、そのアプローチを平易に記していました。Anthropicは、最先端のLLM開発のためのセーフガードは「ユーザーには見えない」と述べていました。その一文はランプの調光器のように着地しました――出力はまだありましたが、明るさはこっそりと絞ることができたのです。

「サイバーセキュリティ、生物学、化学、そして蒸留の試みに対する私たちの介入とは異なり、これらのセーフガードはユーザーには見えません。Fable 5は異なるモデルにフォールバックしません。代わりに、セーフガードはプロンプトの変更、ステアリングベクトル、またはパラメータ効率の良いファインチューニング(PEFT)などの方法を通じて有効性を制限します。」

実際には、プロンプトが最先端モデルをトレーニングしようとしている兆候を示したとき、Fable 5は拒否したり、鈍くて弱いモデルに切り替えたりしませんでした。それは静かにプロンプトを変更したり、内部ベクトルをシフトさせたりして、出力が他のモデルをトレーニングするのに役立たないようにしました。Anthropicの利用規約では、同社のモデルをトレーニングソースとして使用することはすでに禁止されていますが、ここでの秘密主義は、コードに焼き付けられた隠された欠陥のように感じられました。

なぜAnthropicはFable 5を弱体化させたのか?

Anthropicからの短い答えは、リスク管理です。Mythos――親モデル――は、ガードレールなしで使用された場合、非常に強力で潜在的に危険であると内部で位置づけられていました。Fable 5は、消費者向けの「弱体化された」兄弟でした。Anthropicの選択は、明白な露骨な拒否と、悪意のあるアクターに気づかせることなく不正使用を停止するように設計された秘密裏の介入との間でした。

フォーラムで、ユーザーは目に見えないガードレールを裏切りと表現した

Redditのコメントの一つがそのムードを要約しました。CheatCodesOfLifeはそれを「あなたのお金を奪って、あなたのコードベースを毒すること」と呼びました。その理由がわかります。あなたがアクセスにお金を払っていて、あなたの入力があなたの知らないうちに改変されているなら、信頼は蒸発します。

その信頼の侵食は、エンタープライズや研究者のワークフローが予測可能な動作に依存しているため、重要です。Anthropicの目に見えないアプローチは、外科的な処置を試みましたが、多くの人にとっては、親切さを装ったトロイの木馬――ヘルプフルネスを装ったセキュリティ――のように感じられました。

AnthropicはFable 5のセーフガードを変更するのか?

はい。反発の後、AnthropicはWiredに、その特定のセーフガードを可視化すると語りました。同社は「最先端LLM開発のためのFable 5のセーフガードを、それらを可視化するように変更します」と述べました。

また、謝罪も発表しました。「我々は間違ったトレードオフを犯し、バランスを間違えたことをお詫びします。」この分野では珍しい率直さであり、それは具体的な是正措置を示唆しています。秘密裏の緩和策を、明示的で検査可能な動作に置き換えることです。

これが研究者、企業、プラットフォームをどうするのか

モデルを構築している場合、Fable 5とClaudeファミリー製品から何を期待すべきかについてのより明確な地図ができました。AnthropicはXとRedditでの怒りを認識し、具体的な変更を引用しました。Wiredと会社自身のPDFモデルカードは、その変化の公的な証拠です。

プラットフォームオペレーター――OpenAI、Anthropic、クラウドプロバイダー――にとって、この瞬間は選択を迫ります。制約について透明であるか、コミュニティの反乱をリスクにさらすかです。開発者にとっては、入力と出力を監査し、ベンダーがあなたを保護していると主張するときに監査可能な境界を要求することを思い出させるものです。

Anthropicは謝罪し、可視性を約束しました。それが信頼を回復するかどうかは、実装と、新しい動作が実際にはどれほど明確であるかにかかっています。あなたは、秘密裏の破壊行為よりも、目に見える拒否を受け入れるのか、あるいはプロバイダーからのいかなる制限も、研究者とツールの間の社会契約を破るのか?

私たちの活動を応援してください ❤️

この記事を気に入っていただけたら、今後も質の高いコンテンツを発信し続けられるようチップのご支援をご検討ください。

PayPalでの安全な支払い
関連項目:  AIはバードウォッチングをどう台無しにするか:野生生物と愛好家へのリスク
Moyens I/O のスタッフはあなたをやる気にさせ、テクノロジー、自己啓発、ライフスタイル、そしてあなたを助ける戦略についてのヒントを提供してくれます。