AI で作成された小説や絵画がコンクールで賞をとるという問題が起こって、AIで作成したことを後から検証できるような電子透かしが用いられるようになっている。Google が開発した Watermarking という方法に基づく SynthID と言うツールが Google や Open AI モデルには実装されており、秘密の鍵を用いると作成が AI によるものかどうかがわかるようになっている。
今日紹介する Google Deep Mind からの論文は、同じ watermarking を、AI でデザインしたタンパク質や分子構造に当てはめることで、AI デザインという来歴をすり込む方法の開発で、9月30日 Nature にオンライン掲載された。タイトルは「Function-preserving watermarking of AI-generated proteins(AI によりデザインされたタンパク質を機能を維持して watermarking する)」だ。
専門外なのでザクッと理解しているだけだが、watermarking では例えば文章を生成するとき、次のトークンを選ぶ時の確率を最適な選択から少しずらして選ぶことで、選び方の偏りをわざと組み込むことで AI によって作成されたことが後からわかるようになっている。大事な点は、読んでいるときその違いがわからないほどのずれにすることで、だれも透かしが入っていることに気づかないようにしている。
さて、この watermarking をタンパク質デザインにも使えるかだが、まずアミノ酸配列としてデザインするケースを考えている。例えば構造からアミノ酸配列を生成する ProteinMPNN は何度も紹介しているが、これに自然言語の LLM で使うトーナメントサンプリングと呼ばれる秘密のキーに従ってサンプルするトークンにバイアスをかける SynthID を組み込んでいる。原理的には単語に対応するトークンがアミノ酸に対応するようになっただけだが、大きな問題は、単語の場合は同義語も多くずらしても文章の質が守れるが、次のアミノ酸となると選ぶ相手は20種類しかなく、選ぶ時の自由度が低い場合が多い。即ち watermark が入らない。そのため、自由度を上げて他のアミノ酸も選べる distortionary watermarking という方法を使っている。ただ、この方法で本来の構造を壊さずに自動的に透かしが入る様になるのは素人の私には理解しがたい。
これについては watermark を入れた後のタンパク質の構造について、コロナウイルススパイク、血管増殖因子VEGF-A、そしてチェックポイント分子PD-L1に結合するタンパク質を、watermarker なし、自由度を変化させた distortionary watermarking 、そして自由度を変化させない方法で200以上のタンパク質を作成し、タンパク質を合成させて確かめている。結論はどちらの water marking でも結合力の低下は軽微でとどまったと結論している。ただ、図を見たところスパイクに対するバインダーを distortionary watermarking した場合は結合が低下しているが、逆に VEGF-A に対する場合は通常の自由度で water marking した方が結合が低下しているように見えるので、今後さらに厳密に評価する必要があるように感じた。いずれにせよ、watermarking をしても構造を保てる可能性はあることは間違いなく、今後さらに改良が進むのだろう。
同じような電子透かしを AlphaFold3 (AF3) のような3次元構造予測に適用する SynthlDBio-structure と呼ぶモデルも開発している。言語と同じ方法が使える塩基配列は変化させられないので、そこから予測される構造に watermarking が入るようにしている。数理的な処理はもちろん理解出来ている訳ではないが、AF3がdiffusion でノイズを消して正しい原子間座標を描かせるときに、モデル自体がノイズを消す段階で少しずらして watermark が自然に入るように AF3 をファインチューニングしている。
この勝手にずらして watermarking を構造に入れる AF3 に配列をインプットして予測される構造は、これまでの AF3 を使って予測した構造とほとんど違いがない。ということは watermarkingは 無視して予測された構造を使うことができる。
以上が結果で、これまで画像などの知財を守る意味で watermarking が開発され、Google、Open AI、Anthropic などの LLM に実装されているのは知っていた。画像や文章、更には音楽など、AI によることがわかることは重要で、当然のことだと思う。しかし、塩基配列や分子構造が AI 由来であることを明示する電子透かしが本当に必要かは実感がない。と言うのも、現在の研究では AI で機能的タンパク質をデザインすることが重要な課題なので、AIでデザインしたことを研究者が隠すという状況は考えにくい。
それでも論文の discussion では私には全く思いつかない、watermarking を必要とするいくつかの状況が議論されている。最初の例は DNA を受託している合成会社で、現在も危険 DNA 配列データベースと比較して、安全性に問題がある DNA は合成を拒否しているようだ。今後 AI で合成される配列の注文が増えると、スクリーニング作業は大変になるが、最初から AI でデザインしたと注文を受けた配列に watermarking が確認できると、顧客をより信用できるというわけだ。
もちろん、AIデザインの配列がGeneBankやタンク室構造のデータベースに忍び込むことを防ぐことも出来る。
結果は以上で、タンパク質デザインにも電子透かしの必要性が議論されていることに全く気づかなかったのは恥じ入るし、AIトップを走る研究所が率先して様々なリスクを議論していることには感心した。しかし、意図した結果の再現性を重視する科学で、検出できないとは言え敢えてwatermarkingのために結果をずらすという行為が受け入れられるか、科学のあり方まで変える必要がある気がする。

はDNA を受託している合成会社で、現在も危険 DNA 配列データベースと比較して、安全性に問題がある DNA は合成を拒否している。
imp.
バイオテロ防止に使えそうです。