PD-L1·VEGF-A 등 결합체서 기능 유지 확인…DNA 합성 스크리닝·바이오 데이터 관리 활용 기대
사진=구글 딥마인드
[메디게이트뉴스 이지원 기자] 인공지능(AI)이 새로운 단백질을 직접 설계하는 시대가 열리면서, 이제는 AI가 만든 단백질의 '출처'를 확인하는 기술도 필요해지고 있다. 이에 구글 딥마인드는 AI 설계 단백질에 워터마크를 삽입하면서도 표적 결합 기능을 유지하는 기술을 개발해 바이오 분야의 출처 추적 가능성을 제시했다.
구글 딥마인드는 지난달 30일 합성생물학용 워터마킹 기술 '신스ID 바이오(SynthID Bio)'를 공개했다. 연구진은 이번 연구를 AI가 만든 단백질의 기능을 훼손하지 않으면서 출처를 확인할 수 있는 워터마크를 적용할 가능성을 보여준 개념증명 연구로 제시했다. 관련 연구결과는 국제학술지 '네이처(Nature)'에 게재됐다.
AI는 단백질 구조를 예측하는 수준을 넘어 새로운 단백질을 직접 설계하는 데 활용되고 있다. 이에 따라 AI가 만든 단백질의 출처를 확인할 필요성도 커지고 있다.
연구진에 따르면 현재 DNA 합성업체들은 주문받은 서열을 알려진 위험 병원체나 유해 서열 데이터베이스와 비교해 위험 가능성을 점검한다. AI가 기존 데이터베이스에 없는 새로운 서열을 만들어낼 경우 기존 방식만으로는 해당 서열의 성격이나 출처를 파악하기 어려워 추가 검토가 필요할 수 있다.
AI가 만든 단백질 서열이나 구조가 별도 표시 없이 공개 데이터베이스에 쌓이는 것도 문제다. 실제 관찰이나 실험을 통해 얻은 데이터와 AI 생성 데이터가 뒤섞이면 이를 활용하는 후속 연구의 신뢰성에도 영향을 줄 수 있다.
이에 구글 딥마인드는 AI가 생성한 생물학적 데이터의 출처를 확인할 수 있도록 신스ID 바이오를 개발했다. 단백질을 구성하는 아미노산 서열이나 예측된 3차원 구조 안에 나중에 확인할 수 있는 신호를 심어두는 방식이다.
단백질 서열에는 아미노산 배열 자체에 워터마크를 넣는다. 단백질의 아미노산 서열을 설계하는 AI 모델인 '프로틴MPNN(ProteinMPNN)'이 어떤 아미노산을 선택할지 결정하는 과정에서 특정 패턴이 남도록 했다. 파일에 별도 표시를 붙이는 것이 아니라 실제 만들어지는 단백질의 서열 안에 신호를 넣는 것이다.
PD-L1·VEGF-A 표적에 워터마크 삽입…결합 기능 유지
연구진은 앞선 구글 딥마인드의 단백질 결합체 설계 AI '알파프로테오(AlphaProteo)'의 연구에서 실제 표적 결합이 확인된 단백질 구조를 활용했다. 이를 프로틴MPNN으로 다시 서열화하면서 워터마크를 넣은 단백질과 넣지 않은 단백질을 만들어 성능을 비교했다.
표적은 PD-L1과 VEGF-A, SARS-CoV-2 RBD였다. 시험관 실험 결과 워터마크를 넣더라도 표적 단백질에 결합하는 성공률과 결합 성능에서 유의한 차이가 나타나지 않았다.
SARS-CoV-2 RBD를 표적으로 한 단백질에서는 낮은 나노몰 수준, VEGF-A와 PD-L1에서는 이보다 더 강한 서브나노몰 수준의 결합력을 가진 단백질이 확보됐다. 특정 AI 설계 과정에서 만들어졌음을 확인할 수 있는 신호를 넣으면서도 원래 설계 목적인 표적 결합 기능을 유지할 수 있음을 실험적으로 확인한 것이다.
연구진은 단백질의 3차원 구조에도 워터마크를 적용했다. 단백질 등 생체분자의 3차원 구조를 예측하는 AI '알파폴드3(AlphaFold 3)'를 일부 조정해 예측된 구조 안에 검출 가능한 신호가 포함되도록 했다.
워터마크를 넣더라도 구조 예측 성능은 크게 떨어지지 않았다. 잘못 워터마크가 있다고 판단하는 비율을 0.1%로 설정했을 때 실제 워터마크를 찾아내는 비율은 99.8%를 넘었다. 구조 좌표를 조금 바꾸거나 디지털 노이즈를 추가한 뒤에도 워터마크 신호가 상당 부분 유지됐다.
DNA 합성 스크리닝에 활용 기대…고의적 제거 대응은 과제
구글 딥마인드는 신스ID 바이오를 바이오보안을 강화하기 위한 보조 수단으로 활용할 수 있을 것으로 보고 있다.
DNA 합성업체가 주문받은 서열에서 워터마크를 확인하면 해당 서열이 일정한 안전장치를 갖춘 AI 설계 도구에서 만들어졌는지를 판단하는 추가 정보로 활용할 수 있다는 설명이다.
생물보안 정책 전문가인 사라 카터 사이언스 폴리시 컨설팅 수석은 "신스ID 바이오는 생물학적 설계의 출처를 추적하기 위한 중요한 퍼즐 조각"이라며 워터마크가 AI 모델 개발자와 DNA 합성업체의 안전관리에도 활용될 수 있다고 평가했다.
Protein Data Bank(PDB), UniProt, GenBank 등 생물학 데이터베이스에서도 AI가 만든 데이터를 실제 관찰·실험 데이터와 구분하거나 추가 검토 대상으로 분류하는 데 활용할 수 있다.
구글 딥마인드는 신스ID 바이오가 바이오보안 문제를 단독으로 해결하는 수단은 아니라고 언급했다. 워터마크가 확인됐다고 해당 서열이 안전하다는 의미는 아니며, 위험한 서열인지 판단하는 기존 스크리닝 등을 함께 사용하는 다층적인 바이오보안 체계의 한 요소로 활용할 수 있다는 것이다.
연구진 역시 이번 기술을 개념증명 단계로 평가했다. 실제 바이오보안 체계에 적용하려면 추가적인 기술 개발과 산업계의 협력·표준화가 필요하다는 것이다.
워터마크를 의도적으로 제거할 수 있다는 한계도 확인됐다. 단백질 서열을 프로틴MPNN으로 다시 설계하면 서열에 있던 워터마크를 없앨 수 있었고, 3차원 구조에 삽입된 워터마크도 구조를 다시 조정하는 과정에서 약해지거나 사라질 수 있었다.
연구진은 실제 활용을 위해 이러한 의도적인 변형에도 견딜 수 있도록 워터마크의 내구성을 높이고, DNA 합성업체와 연구기관 등 관련 분야의 협력과 표준화가 필요하다고 설명했다.
한편 구글 딥마인드는 적용 범위를 단백질에서 유전체로도 넓히고 있다. 스탠퍼드대학교와 아크연구소 연구진과 함께 유전체 생성 AI 'Evo 2'가 설계한 박테리오파지 유전체에도 신스ID 바이오를 적용하고 있다.
초기 실험에서는 워터마크가 적용된 박테리오파지가 실제 세균 배양 환경에서도 기능하는 것으로 확인됐다. 구체적인 연구결과는 향후 별도 기술논문을 통해 공개할 예정이다.