10月5日 AIが使われたことを示す電子透かしをデザインタンパク質に入れる(9月30日Natureオンライン掲載論文)
AASJホームページ > 2026年 > 10月 > 5日

10月5日 AIが使われたことを示す電子透かしをデザインタンパク質に入れる(9月30日Natureオンライン掲載論文)

2026年10月5日
SNSシェア

AIで作成された小説や絵画がコンクールで賞をとるという問題が起こって、AIで作成したことを後から検証できるような電子透かしが用いられるようになっている。Googleが開発したWatermarkingという方法に基づくSynthIDと言うツールがGoogleやOpen AIモデルには実装されており、秘密の鍵を用いると作成がAIによるものかどうかがわかるようになっている。

今日紹介するGoogle Deep Mindからの論文は、同じwatermarkingを、AIでデザインしたタンパク質や分子構造に当てはめることで、AI デザインという来歴をすり込む方法の開発で9月30日Natureにオンライン掲載された。タイトルは「Function-preserving watermarking of AI-generated proteins(AIによりデザインされたタンパク質を機能を維持してwatermarkingする)」だ。

専門外なのでザクッと理解しているだけだが、watermarkingでは例えば文章を生成するとき、次のトークンを選ぶ時の確率を最適な選択から少しずらして選ぶことで、選び方の偏りをわざと組み込むことでAIによって作成されたことが後からわかるようになっている。大事な点は、読んでいるときその違いがわからないほどのずれにすることで、だれも透かしが入っていることに気づかないようにしている。

さて、このwatermarkingをタンパク質デザインにも使えるかだが、まずアミノ酸配列としてデザインするケースを考えている。例えば構造からアミノ酸配列を生成するProteinMPNNは何度も紹介しているが、これに自然言語のLLMで使うトーナメントサンプリングと呼ばれる、秘密のキーに従ってサンプルするトークンにバイアスをかけるSynthIDを組み込んでいる。原理的には単語に対応するトークンがアミノ酸に対応するようになっただけだが、大きな問題は、単語の場合は同義語も多くずらしても文章の質が守れるが、次のアミノ酸となると選ぶ相手は20種類しかなく、選ぶ時の自由度が低い場合が多い。即ちwatermarkが入らない。そのため、自由度を上げて他のアミノ酸も選べるdistortionary watermarkingという方法を使っている。ただ、この方法で本来の構造を壊さずに自動的に透かしが入る様になるのは素人の私には理解しがたい。

これについてはwatermarkを入れた後のタンパク質の構造について、コロナウイルススパイク、血管増殖因子VEGF-A, そしてチェックポイント分子PD-L1に結合するタンパク質を、watermarker なし、自由度を変化させたdistortionary watermarking、そして自由度を変化させない方法で200以上のタンパク質を作成し、タンパク質を合成させて確かめている。結論はどちらのwater markingでも結合力の低下は軽微でとどまったと結論している。ただ、図を見たところスパイクに対するバインダーをdistortionary watermarkingした場合は結合が低下しているが、逆にVEGF-Aに対する場合は通常の自由度でwater markingした方が結合が低下しているように見えるので、今後さらに厳密に評価する必要があるように感じた。いずれにせよ、watermarkingをしても構造を保てる可能性はあることは間違いなく、今後さらに改良が進むのだろう。

同じような電子透かしをAlphaFold3(AF3)のような3次元構造予測に適用するSynthlDBio-structureと呼ぶモデルも開発している。言語と同じ方法が使える塩基配列は変化させられないので、そこから予測される構造にwatermarkingが入るようにしている。数理的な処理はもちろん理解出来ている訳ではないが、AF3がdiffusionでノイズを消して正しい原子間座標を描かせるときに、モデル自体がノイズを消す段階で少しずらしてwatermarkが自然に入るようにAF3をファインチューニングしている。

この勝手にずらしてwatermarkingを構造に入れるAF3に配列をインプットして予測される構造は、これまでのAF3を使って予測した構造とほとんど違いがない。ということはwatermarkingは無視して予測された構造を使うことができる。

以上が結果で、これまで画像などの知財を守る意味でwatermarkingが開発され、Google, Open AI, AnthropicなどのLLMに実装されているのは知っていた。画像や文章、更には音楽など、AIによることがわかることは重要で、当然のことだと思う。しかし、塩基配列や分子構造がAI由来であることを明示する電子透かしが本当に必要かは実感がない。と言うのも、現在の研究ではAIで機能的タンパク質をデザインすることが重要な課題なので、AIでデザインしたことを研究者が隠すという状況は考えにくい。

それでも論文のdiscussionでは私には全く思いつかない、watermarkingを必要とするいくつかの状況が議論されている。最初の例はDNAを受託している合成会社で、現在も危険DNA配列データベースと比較して、安全性に問題があるDNAは合成を拒否しているようだ。今後AIで合成される配列の注文が増えると、スクリーニング作業は大変になるが、最初からAIでデザインしたと注文を受けた配列にwatermarkingが確認できると、顧客をより信用できるというわけだ。

もちろん、AIデザインの配列がGeneBankやタンク室構造のデータベースに忍び込むことを防ぐことも出来る。

結果は以上で、タンパク質デザインにも電子透かしの必要性が議論されていることに全く気づかなかったのは恥じ入るし、AIトップを走る研究所が率先して様々なリスクを議論していることには感心した。しかし、意図した結果の再現性を重視する科学で、検出できないとは言え敢えてwatermarkingのために結果をずらすという行為が受け入れられるか、科学のあり方まで変える必要がある気がする。

カテゴリ:論文ウォッチ
2026年10月
月火水木金土日
« 9月  
 1234
567891011
12131415161718
19202122232425
262728293031