AASJホームページ > 新着情報 > 論文ウォッチ > 7月26日 MSA PairformerというAIの新しい方向(7月21日Cellオンライン掲載論文)

7月26日 MSA PairformerというAIの新しい方向(7月21日Cellオンライン掲載論文)

2026年7月26日
SNSシェア

自分のガンのRNAデータを見ていると、例えば分子Aは分子Bと結合するだろうかなどと疑問が出る。この分子間相互作用については膨大な研究があり、例えばK-rasがどの分子と結合するのかなどは文献を探すことでかなりわかるのだが、AとBをインプットして結合するかどうか判断してくれるAIがあればさらに便利だ。

今日紹介するMITからの論文は、まさにこのようなリクエストに正確に答えることができるAIモデルについての研究で、7月21日Cellにオンライン掲載された。タイトルは「Expanding the scope of protein language modeling to protein-protein interactions with MSA Pairformer(タンパク質の言語モデリングをタンパク質同士の相互作用に拡大するMSA Pairformer)だ。

例によって数理部分をほとんど理解せず紹介していることを断っておく。

さて、ほとんどのタンパク質についてのLLMは、個別のタンパク質を学習して、それらが分布する進化コンテクストの潜在空間を作っており、異なるタンパク質の相互作用に関するデータは存在しない。そのため構造を予測してから相互作用するか計算することになる。例えばKRASとRAF1が結合するかどうかを調べようと思うと、頭に浮かぶのはAlphaFold-multimerやAlphaFold3を用いて構造を予測して相互作用の可能性を計算する方法だ。元になるAlphaFoldは、構造を決定するとき、可能な限り多くの異なる種のアミノ酸配列を比較するMultiple sequence alignment(MSA)を作成し、またアミノ酸残基間の位置関係を記録するPair representationを作成する。これからTransformer/attentionで特徴抽出を行い、構造もデジュールで構造をアウトプットしている。従って、K-rasとRafの構造を予測した後、結合面があるかを計算することになる。

この研究では、MSAとpair representationは一つのタンパク質の異なるアミノ酸残基の共進化と位置関係を表現しているので、わざわざ計算の大変な構造予測まで進まず、MSAとpair representationだけで、アミノ酸同士の結合を予測できるのではと考えた。さらに、可能な限り多くのアミノ酸配列のMSAではなく、例えばヒトのK-rasに近いアミノ酸配列を重み付けしてMSAやpair representationを形成することで、予測精度を挙げられると考えた。

そしてまず普通のLLMと同じように多くのタンパク質を学習させたあと、相互作用するか比べたいタンパク質AとBを、あたかも一本のタンパク質に統合して調べる、Paired MSA方法を考案した。もしA,Bが相互作用している場合は、MSAを作成することで、セットで共進化するアミノ酸残基の組み合わせが見つかると予想され、見つかった場合はその残基同士が相互作用時の結合部位になっていると考えられる。もちろん全く共進化がないとすると、相互作用のないタンパク質ということになる。

この時、通常のTransformerと異なり、著者らがQuery Biased Outer Productと呼ぶ方法を考案し、例えば調べたいhuman K-ras とRafに近い配列でpaired MSAを作成し、アミノ酸残基の関係が抽出されたpair representationから相互作用するかどうか、どこで結合するのか、結合の強さはどうか等を計算することができるようにしている。

重要なのは、実際の構造予測をスキップしているおかげで、小さなワークステーションで住む点で、著者らはMSA pairformerでは一つのH100 GPUで10日あればトレーニング可能で、大規模なESM2モデルのように512題のH100 GPUを使う必要がないことを強調している。

後は、既に知られている例えばバクテリアのトキシンとアンチトキシンやABCトランスポーターなどいくつかのタンパク質について、分子間相互作用を数値化できるか、変異が起こったときの相互作用の変化を予測できるか、等を他のモデルと比較し、MSA pairfomerが高いパーフォーマンスを示すことを明らかにしているが、詳細は全て割愛する。

以上、数理については全く理解せずに紹介していることを繰り返すが、これまで一本のアミノ酸に限定されていたMSAやpair representationを、異なるタンパク質を一本に統合するPaired MSAを考案して、タンパク質同士の相互作用を正確に予測できるようにしたことは、私のような素人にもコロンブスの卵のような素晴らしいアイデアに思える。しかも、一般的なMSAのように可能な限り多くのアミノ酸のアラインメントをとるのではなく、知りたい(Query)分子に近い(biased)タンパク質を重み付けしてアラインメントをとることで情報の質を高め、3次元構造生成をスキップして、計算コストを大幅に下げたということは、何でもかんでも大きなモデルを作ってそのパーフォーマンスを誇るのではない、新しい方向性を示しているように感じた。

おそらく私の説明では不十分だと思うので、是非自分で論文を読まれることを勧める。

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です

*


reCaptcha の認証期間が終了しました。ページを再読み込みしてください。