'KJR'에 전립선 MRI 구조화 판독 도구 '바이브코딩' 사례 보고…"만든 뒤 검증·관리 체계가 관건"
PI-RADS 버전 2.1을 기반으로 구축된 전립선 MRI용 바이브 코딩 기반 단일 파일 PI-RADS 판독 보고 도구. 출처=Is Vibe Coding a ‘Fire of Prometheus’ for Non-Developer Clinicians, Especially Clinical Radiologists?
[메디게이트뉴스 이지원 기자] 코딩을 전문적으로 배운 적 없는 영상의학과 의사가 생성형 인공지능(AI)과 약 4시간 대화한 끝에 전립선 자기공명영상(MRI) 판독을 돕는 프로그램을 만들 수 있는 시대가 열렸다. 개발자에게 의존하지 않고 의료진이 현장에서 필요한 작은 임상도구를 직접 만들 수 있는 가능성이 커진 것이다. 다만 이러한 프로그램이 실제 진료현장으로 들어가기 위해서는 정상적으로 작동하는지를 넘어 안전성과 환자정보 보호, 검증과 관리체계까지 함께 갖춰야 한다.
이와 함께 직접 개발한 임상도구를 실제 의료현장에 활용하기 위해서는 전문성 유지와 보안·환자정보 보호, 동료 검토, 기관 차원의 관리체계가 필요하다고 강조했다. 이에 연구은 개인 의료진을 필요한 도구를 직접 만드는 '도구 제작자(tool maker)', 의료기관을 이를 검증하고 관리하는 '거버넌스 권한자(governance authority)'로 제시했다.
연구팀은 바이브코딩의 양면성을 '프로메테우스의 불'에 빗대며 "영상의학 전문의들에게 긍정적인 영향과 부정적인 영향을 동시에 미칠 수 있으며, 그 영향은 기술 자체보다 해당 분야가 얼마나 책임감 있게 이를 도입하느냐에 따라 결정될 것"이라고 밝혔다.
개발자 없이 '4시간' 만에…의료진이 임상도구 직접 만든다
바이브코딩은 사용자가 원하는 프로그램의 기능을 자연어로 설명하면 대규모언어모델(LLM)이 코드를 생성·수정하는 방식이다. 직접 코드를 작성하지 않아도 돼 프로그래밍 경험이 없는 의료진도 진료나 연구에 필요한 프로그램을 만들 수 있다.
연구팀은 실제 사례로 '전립선영상보고데이터체계(PI-RADS) 기반 전립선 MRI 구조화 판독 도구'를 소개했다. 해당 프로그램은 프로그래밍 전문교육을 받지 않은 영상의학과 의사가 LLM 기반 코딩 도구와 자연어로 대화하며 약 4시간 만에 완성했다.
프로그램은 전립선 크기와 병변 정보를 입력하면 전립선 용적과 전립선특이항원(PSA) 밀도를 자동 계산하고 대표 병변을 지정해 표준화된 판독문을 생성한다.
이 프로그램 개발의 의미는 빠른 개발 속도에 그치지 않는다. 기존에는 시간과 인력, 비용 때문에 우선순위를 얻기 어려웠던 작고 구체적인 임상 현장의 요구까지 의료진이 직접 구현할 수 있게 됐다.
연구팀은 "기존 의료 AI 개발은 상당한 자원이 필요한 만큼 상업성이 있는 모델을 중심으로 이뤄져 왔다. 상업화 가능성이 명확하지 않은 작지만 임상적으로 중요한 워크플로 개선은 흔히 간과돼 왔다"며 "바이브코딩은 이러한 장벽을 낮춘다. 특히 하반기 들어 더욱 발전한 에이전틱 AI의 기술로 현재는 같은 프로그램을 한 두번의 시도만으로 30분 이내 완성할 수 있다"고 밝혔다.
연구팀은 특히 영상의학과가 바이브코딩을 활용하기에 적합한 진료과라고 언급했다. 영상의학과는 PACS와 영상정보시스템(RIS), 전자의무기록(EMR) 등 디지털 시스템 사이의 데이터 흐름과 연계를 오래 다뤄왔고, 의료 AI 개발에서도 임상 문제 정의와 데이터 구성, 결과 검증 등에 참여해왔기 때문이다. 또한 반복적이고 규칙이 명확한 업무가 많다는 점을 적합한 요인으로 꼽았다.
이에 연구팀은 영상의학과 의사의 역할도 AI 결과를 사용하는 데서 나아가 여러 도구를 검증해 실제 진료 흐름에 연결하는 '임상 워크플로 오케스트레이터'로 확대될 수 있다고 전망했다.
'작동하는 코드'가 '안전한 코드'는 아니다…전문성·보안은 숙제
프로그램을 쉽게 만들 수 있게 됐다고 해서 이를 제대로 이해하고 검증할 능력까지 함께 생기는 것은 아니다.
연구팀은 바이브코딩이 비개발자에게 실제 능력 이상으로 코드를 이해하고 있다는 '역량의 착시'를 만들 수 있다고 지적했다. 특히 연구용 프로그램에서는 오류가 프로그램 구현을 넘어 연구대상군 정의와 변수 처리, 모델 선택, 통계분석과 결과 해석 등 연구방법론 자체에 영향을 미칠 수 있다고 언급했다.
AI가 만든 결과물을 다시 AI에게 검토하도록 하는 방식에도 한계가 있다.
연구팀은 "자신의 출력을 검토하도록 요청받은 모델은 그 출력을 만들어낸 맹점까지 물려받기 때문에 검증은 모델 외부에서 이뤄져야 한다"며 "가능한 경우에는 결정론적 검증을 하고, 그렇지 않은 경우에는 자격을 갖춘 사람이 방법론을 검토해야 한다"고 밝혔다.
보안 위험도 코드 자체에 머물지 않는다. 외부 패키지와 설치 프로그램, 데이터 저장 방식뿐 아니라 프롬프트와 화면 캡처, 디버그 로그, 공개 저장소 등도 환자정보나 병원 내부정보의 유출 경로가 될 수 있다.
연구팀이 인용한 외부 연구에서는 100개가 넘는 LLM이 생성한 코드 표본의 약 45%에서 취약점이 발견됐다. 1400개 이상의 바이브코딩 애플리케이션을 분석한 별도 조사에서도 중대한 취약점과 비밀정보 유출, 의료기록을 포함한 개인정보 노출 사례가 확인됐다.
이에 연구팀은 비개발자 의료진이 코드 전체의 안전성을 직접 확인하기 어렵다는 점을 고려해 프로그램의 기능 자체를 제한하는 방안을 현실적인 대안으로 제시했다.
연구팀은 "비개발자 임상의에게 현실적인 접근은 단순히 도구가 무엇을 하는지 살피는 데 그치지 않고, 애초에 무엇을 할 수 있는지 제한하는 것"이라고 강조했다. 네트워크 연결과 외부 의존성, 환자식별정보 입력 기능 등을 처음부터 없애 위험 가능성을 줄이는 방식이다.
앞서 개발된 PI-RADS 도구도 외부 프로그램에 의존하거나 네트워크에 접속하지 않는 단일 HTML 파일로 만들고 환자식별정보를 입력하는 항목을 두지 않았다.
환자정보를 읽거나 저장·전송해야 한다면 기관 차원의 검토가 필요하다. 연구은 개인 의료진의 판단이 아닌 기관이 승인한 절차를 통해 사용해야 하며, 온프레미스 LLM 역시 정보의 외부 전송 위험을 낮출 뿐 취약한 코드와 외부 의존성, 유지관리 문제까지 해결하지는 못한다고 지적했다.
분당서울대병원 바이브랩 월례 회의 모습. 출처=Is Vibe Coding a ‘Fire of Prometheus’ for Non-Developer Clinicians, Especially Clinical Radiologists?
의사가 만든 프로그램 늘어나면 누가 관리하나…평가부터 폐기까지 체계 필요
의료진이 직접 개발한 프로그램이 병원 안에서 늘어날수록 개별 도구의 개발을 넘어 검증부터 도입, 업데이트, 폐기까지 관리하는 체계가 필요해진다. 이에 연구팀은 진료과와 병원, 전문학회가 내부 프로그램을 평가하고 채택한 뒤 업데이트하고 필요할 경우 폐기하는 관리체계를 갖춰야 한다고 제안했다.
개별 개발이 확산될 경우 비슷한 기능의 도구가 중복되거나 서로 호환되지 않는 데이터 구조가 생길 수 있고, 프로그램마다 보안 수준이 달라질 수 있기 때문이다. 또한 개발자가 부서를 옮기거나 병원을 떠난 뒤 유지보수가 중단될 가능성이 있다.
이어 연구팀은 개발 과정에서의 동료 검토도 필요하다고 언급했다. 바이브코딩은 의료진이 다른 전문가에게 코드나 개발 과정을 공개하지 않고도 프로그램을 완성할 수 있어 빠른 개발이 검증 절차의 부재로 이어질 수 있기 때문이다.
연구팀은 "의료진은 코드와 가정, 워크플로 논리를 다른 전문가에게 공개하지 않고도 도구를 만들 수 있다"며 정기적인 '쇼 앤 텔(Show & Tell)' 등을 통한 동료 검토를 제안했다.
분당서울대병원은 올해 5월 '바이브 랩(Vibe Lab)'을 출범해 의료진의 직접 개발을 병원 안에서 실험하고 있다. 논문 작성 당시 정식 프로그래밍 교육을 받지 않은 15개 진료과 교수 28명이 참여하고 있었으며, 공학박사 출신 연구교수의 기술 자문과 교육·실습, 참여자가 만든 프로그램을 공유하는 '쇼 앤 텔(Show & Tell)' 등을 진행했다.
단 이러한 동료 검토가 병원의 공식 보안심사를 대신하는 것은 아니다. 연구팀은 환자정보를 다루는 프로그램은 실제 사용에 앞서 별도의 기관 개인정보·보안 검토를 거쳐야 한다고 당부했다.
관리 수준의 균형도 필요하다. 연구팀은 "지나치게 엄격한 거버넌스는 창의성을 억누를 수 있고, 지나치게 허용적인 거버넌스는 상호운용성과 책임성, 환자안전을 훼손할 수 있다"고 지적했다.
연구팀은 "프로메테우스가 준 불이 인간을 따뜻하게도 하지만, 몽땅 태울 수도 있다. 이처럼 코드가 혁신을 이끌어낼지, 그 가치를 만들어내는 전문성을 훼손할지는 기술 자체가 아니라 영상의학 분야가 이를 얼마나 책임감 있게 도입하고 관리하는지에 달려 있다"고 부연했다.