7月の静かな午後、チャットのトランスクリプトを開いたとき、胃がきりりと痛んだ。患者で的確なユーザーが、高校生でも理解できる手順で毒物を合成する方法を尋ねたのだ。その会話はいたずらのようには見えなかった。
ウォール・ストリート・ジャーナル(WSJ)の報道を読み、OpenAI、研究者、国防アドバイザーへとつながる道筋をたどった。これは、あなたがメールのドラフト作成やコーディング支援に使っているツールも、その限界まで試されているという、警鐘として読むべきだ。
昨夏、セキュリティチームは毒物や生物兵器に関する数百件の問い合わせを警告した。
この一文は、WSJの報道と、生物学的脅威を研究する人々からのものだ。記事によると、「数百人」の世界中のユーザーがChatGPTに毒物や生物攻撃に関する指示を求めており、情報源には主要AIラボの現・元従業員や外部の政策アドバイザーが含まれていた。
私は自問した:これらは理論的な探求だったのか、それとも実用的な設計図だったのか? WSJは、それらがライブで現実世界でのやり取りであったことを示唆している。一部のトランスクリプトは生物学者やテロ専門家に見せられ、特定の回答は致命的に正確だと判断された。OpenAIは、モデルは有害な要求を拒否し、信頼できる脅威は法執行機関に報告すると述べているが、報告書は多くの禁止措置が正式な通知なしに行われたことを示唆している。
ChatGPTは生物兵器を作成できるか?
短い答え:時には危険なほど有用な詳細を提供できる。WSJによると、多くの問い合わせは高校生でも理解できるレベルで回答されており、専門家は後にいくつかのやり取りが懸念されるほど正確であると判断した。私は誇張もパニックも信用しない――重要なのはパターンだ:実用的な手順を引き出す、繰り返し、忍耐強い探求。
あるユーザーは段階的な指示を求め、別のユーザーはジャンプのためのバイクの改造を求めた。
ニューヨーク・タイムズは以前、ボコ・ハラムのメンバーがチャットボットにバイクの改造について尋ねたことを報じた。このアドバイスは、実践と組み合わせることで、攻撃に必要な十分な跳躍力を生み出した。このエピソードは、技術的な支援と意図がリスクを生むということを思い出させる。あなたも私も、無害なプロジェクトのためにAmazonのマニュアルやYouTubeを使っている。悪意のあるアクターも同じ情報源を利用できる。今のところ、信頼できる書籍や評判の良いマニュアルは、消費者向けチャットボットよりも危険かもしれないが、技術は進歩している。
追加のリスクがある:ハイエンドモデルは「蒸留」されて、どこでも実行できる小型で安価なオープンソースの重みになる可能性がある。Hugging Faceのプラットフォームやコミュニティ、arXivで説明されている技術は、モデルの振る舞いをどのように変更できるかを示している。拒否の振る舞いが削除されると、モデルにエンコードされた知識はすべて引き出される可能性がある。
企業は、ユーザーが武器について尋ねたときに法執行機関に通知するか?
OpenAIはWSJに対し、信頼できる現実世界の脅威を当局に転送していると語った。しかし、報告書の情報源によると、毒物を求めた多くのユーザーは、正式な報告なしに単に禁止されただけだという。このギャップは重要だと私は信じている:追跡なしの検出は、境界線を試すことをいとわない人々に、プレイブックを渡してしまう。
セキュリティチームはパターンを特定できるが、攻撃者は一夜にしてゲームを変えることができる。
科学者や国防専門家による精度チェックは有用だが、それは事後に行われる。WSJは、専門家に見せられてモデルが有害なガイダンスを与えたかどうかを判断したやり取りについて説明した。その事後レビューは、何がうまくいかなかったかを特定するが、必ずしも次の試みを阻止するものではない。
技術のライフサイクルは、調整・再配布可能な消費者製品に似ている。懸念されるモデルは、公には「弱体化」され、その後、誰かが最高入札者に価格――例えば5,000ドル(4,600ユーロ)――で販売するために、検閲されていないバージョンに静かに蒸留される可能性がある。モデルの拒否は剥ぎ取られ、安全策のダムは崩壊するかもしれない。
研究者やプラットフォームはどのように反撃できるか?
ツールは存在する。OpenAIは、リリース前の安全評価と実行時監視を強調している。研究者はarXivで防御的な方法を発表し、業界コンソーシアムを通じて協力している。Hugging Faceや他のコミュニティは、モデル共有のためのガードレールを構築しており、ジャーナリストや政策チームは、法執行機関やラボがより迅速に行動できるように、弱点を名指ししている。
インセンティブを調べる:ユーザー、プラットフォーム、そして蒸留モデルを販売する人々。
市場は、単一のトランスクリプトよりも重要だ。プロプライエタリなフロンティアモデルが、安価なオープンウェイトバリアントに蒸留されると、アクセスは広がり、監視は狭まる。私は3つのシグナルに注目している:危険な問い合わせがどれだけ早く検出されるか、当局に報告されるかどうか、そしてフォークされたモデルで禁止された行動がどれだけ簡単に復元できるか。
この話は二項対立ではない。履歴書作成を支援するチャットボットは、悪用されたツールと同じではない。それでも、その違いは、単一のプロンプトエンジニアリングの行や、トリミングされた拒否モジュールである可能性がある。チャットボットの有用性は、刃が壊れたスイスアーミーナイフのようなものであり、規制は洪水からダムをせき止めるようなものだと感じられるかもしれない。
私の見解:技術的な修正や政策論争は進んでいるが、安心できるほど速くはない。モデルが普及するにつれて、さらに多くのインシデントが発生すると予想されるべきであり、OpenAI、Hugging Face、その他のプラットフォームに対し、当局にいつ通知するか、安全性をどのように評価するか、そしてレッドチームの作業が悪意のあるアクターのマニュアルにならないようにどのように防止するかについて、透明性を示すよう求めるべきだ。モデルが監視され、変更され、再び販売されるようになったとき、誰がモデルを監視するのか?
私たちの活動を応援してください ❤️
この記事を気に入っていただけたら、今後も質の高いコンテンツを発信し続けられるようチップのご支援をご検討ください。






















