레이블이 Foundation Models인 게시물을 표시합니다. 모든 게시물 표시
레이블이 Foundation Models인 게시물을 표시합니다. 모든 게시물 표시

금요일, 10월 02, 2026

AI가 생명의 언어를 배우기 시작했어요

요즘 AI가 글도 쓰고 그림도 그려주면서 참 신기하다 싶었는데, 이젠 우리 몸속 유전자나 단백질까지 공부하기 시작했더라고요. DNA나 RNA 같은 생명체의 설계도를 AI가 직접 읽고 분석한다는 최신 연구가 나와서 살짝 가져와 봤어요.

제목은 **‘Foundation models in bioinformatics’** 인데, 한마디로 생명과학 분야에 등장한 '만능 AI 모델'들이 어디까지 와 있는지 종합적으로 정리한 리뷰 논문이에요.

예전에는 과학자들이 유전자 하나 분석하려면 실험실에서 엄청 고생해야 했는데, 이제는 대단한 양의 데이터를 미리 공부한 AI가 이 과정을 돕고 있거든요. 유전체부터 신약 개발, 단일 세포 분석까지 AI가 생물학에서 어떻게 활약하고 있는지 가볍게 한번 훑어볼게요. :)


DOI:  10.1093/nsr/nwaf028


gemini

바이오인포메틱스(생물정보학) 연구의 새로운 지평을 연 초거대 인공지능 모델에 대한 최신 연구 동향을 일반 성인 독자의 눈높이에 맞춰 알기 쉽게 정리해 드립니다.

**연구 배경**

생물학 실험은 비용이 많이 들고 시간과 노력이 오래 걸리기 때문에, 레이블이 없는 대규모 데이터를 효율적으로 다룰 수 있는 인공지능(AI)의 필요성이 대두되었습니다.

기존의 전통적인 인공지능은 사람이 직접 규칙을 정하는 방식에 의존했으나, 대규모 데이터를 미리 학습하는 사전 훈련 모델(PTM)의 등장으로 생물정보학 연구는 완전히 새로운 전환기를 맞이했습니다.

**연구 목적**

이 연구는 유전체학, 전사체학, 단백질체학, 신약 개발, 단일세포 분석 등 다양한 생물학 분야에서 활약하는 기초 인공지능 모델들의 최신 발전 과정을 체계적으로 소개하는 것을 목적으로 합니다.

연구진은 언어, 비전, 그래프, 멀티모달 등 네 가지 모델 유형을 바탕으로 과학자들이 자신의 연구 목적에 알맞은 모델을 선택할 수 있도록 돕고자 합니다.

**연구 방법**

연구진은 대규모 생물학적 데이터를 분석하기 위해 언어 모델, 비전 모델, 그래프 신경망, 멀티모달 모델 등의 인공지능 아키텍처가 어떻게 활용되는지 광범위한 문헌을 바탕으로 조사했습니다.

특히 DNA와 RNA 서열 분석, 단백질 3차원 구조 예측(예: 알파폴드 시리즈), 신약 후보 물질 발굴, 단일세포 멀티오믹스 통합 분석에 사용된 다양한 딥러닝 기법과 방대한 생물학 데이터베이스를 분석 대상으로 삼았습니다.

**연구 결과**

생물학적 서열 데이터를 자연어처럼 이해하는 트랜스포머 기반의 언어 모델(예: DNABERT, RNA-FM)이 유전체와 전사체 분석에서 뛰어난 성능을 보였습니다.

단백질 구조 예측 분야에서는 알파폴드가 진화를 거듭하여 진화적 서열 정렬(MSA) 의존도를 낮추고 복잡한 생체 분자 복합체의 구조까지 정확하게 예측할 수 있게 되었습니다.

또한 신약 개발 분야에서는 화합물의 특성을 예측하고 타겟 단백질에 맞는 3차원 분자를 직접 생성하는 생성형 인공지능 모델들이 괄목할 만한 성과를 거두었습니다.

**고찰**

인공지능 모델이 방대한 생물학 데이터를 학습하면서 비약적인 발전을 이루었지만, 여전히 모델이 그릇된 정보를 그럴듯하게 만들어내는 '환각 현상'이나 결과의 근거를 명확히 알기 어려운 설명 가능성 부족 등의 문제가 존재합니다.

따라서 앞으로는 모델의 신뢰성을 높이기 위한 엄격한 평가 프레임워크 구축과 더불어, 인과 추론 및 지식 그래프를 결합하여 인공지능의 판단 과정을 투명하게 밝히는 연구가 필수적입니다.

**의의와 시사점**

이 연구는 생물정보학 전반에 걸친 기초 인공지능 모델의 발전사를 한눈에 조망할 수 있는 나침반 역할을 하며, 생명과학과 인공지능의 융합 연구를 촉진하는 기틀을 마련했습니다.

분자 수준의 복잡한 생명 현상을 인공지능으로 정확하게 이해함으로써 맞춤형 의학, 신약 개발, 질병 진단 등 실생활과 직결된 바이오 산업 전반에 혁신적인 변화를 이끌어낼 수 있다는 점에서 큰 시사점을 줍니다.

**이 연구가 왜 중요한가?**

이 연구는 생명과학의 복잡한 비밀을 인공지능이라는 강력한 도구를 통해 풀어내는 현재의 기술적 위치를 정확히 진단하고 미래 방향을 제시하기 때문에 중요합니다.

질병의 원인을 더 빠르고 정확하게 찾아내고 새로운 치료제를 효율적으로 개발할 수 있는 가능성을 열어줌으로써, 인류의 건강과 복지 증진에 크게 기여할 수 있는 핵심 연구이기 때문입니다.


chatGPT

# AI는 생명과학을 어떻게 바꾸고 있을까? 바이오인포매틱스 기반모델의 현재와 미래

최근 인공지능(AI)은 사람의 글을 작성하거나 사진을 만드는 것을 넘어 생명과학 분야에서도 빠르게 활용되고 있습니다. 특히 DNA, RNA, 단백질과 같은 생명체의 정보를 AI가 학습하면서 질병의 원인을 찾고 신약을 개발하는 새로운 방법이 등장하고 있습니다. 이번에 살펴볼 논문은 이러한 변화의 중심에 있는 **‘바이오인포매틱스 기반모델(Foundation Model)’**이 어디까지 발전했으며, 실제 생명과학 문제에 어떻게 활용되고 있는지를 종합적으로 정리한 연구입니다.

## 연구 배경

기존의 인공지능은 하나의 문제를 해결하기 위해 그 문제에 맞는 데이터를 준비하고 별도의 모델을 만드는 경우가 많았습니다. 예를 들어 특정 DNA 서열을 분류하려면 그 목적에 맞는 데이터를 이용해 새로운 AI를 만들어야 했습니다.

하지만 기반모델은 접근 방법이 다릅니다. 먼저 매우 많은 양의 데이터를 이용해 AI를 미리 학습시킨 다음, 이렇게 학습한 지식을 다른 여러 문제에 활용합니다. 사람의 언어를 이해하는 AI가 수많은 글을 먼저 공부한 뒤 번역, 요약, 질문 답변 등에 활용되는 것과 비슷합니다.

생명과학에서도 DNA와 RNA의 서열, 단백질의 구조, 화합물 정보, 단일세포 데이터처럼 엄청난 양의 정보가 쌓이고 있습니다. 그런데 이런 데이터를 사람이 직접 분석하기에는 시간이 너무 오래 걸립니다. 실제 실험 역시 비용과 노동이 많이 필요합니다. 따라서 많은 데이터를 먼저 학습한 AI를 이용하면 생명과학 연구를 더 빠르고 넓게 진행할 수 있다는 가능성이 커졌습니다.

## 연구 목적과 방법

이 논문은 특정 AI 하나의 성능을 실험한 연구라기보다, 지금까지 개발된 **바이오인포매틱스 기반모델을 폭넓게 살펴본 리뷰 논문**입니다.

연구진은 기반모델을 크게 **언어 기반모델, 영상 기반모델, 그래프 기반모델, 멀티모달 기반모델**의 네 가지로 나누어 살펴보았습니다. 그리고 이 모델들이 실제 생명과학의 다섯 영역인 **유전체학, 전사체학, 단백질체학, 신약개발, 단일세포 분석**에서 어떻게 사용되고 있는지를 정리했습니다. 또한 어떤 데이터베이스를 사용하는지, 어떤 방식으로 AI를 사전학습하고 추가 학습하는지, 어떤 생물학적 문제를 해결하는지도 함께 검토했습니다.

쉽게 말하면 이 연구는 “AI가 생명과학에서 무엇을 배웠고, 그것을 어디에 활용할 수 있으며, 앞으로 어떤 문제가 해결되어야 하는가?”를 한눈에 정리한 연구라고 할 수 있습니다.

## 연구 결과 ① DNA를 이해하는 AI

첫 번째 분야는 **유전체학**입니다. DNA에는 생명체의 유전정보가 들어 있습니다. 연구진은 DNA 서열을 일종의 ‘생물학적 언어’처럼 보고 이를 이해하는 여러 AI 모델을 소개합니다.

대표적으로 DNABERT, DNABERT-2, Nucleotide Transformer, HyenaDNA, Evo 등이 있습니다. 이 모델들은 DNA 서열을 학습해 유전자의 작동과 관련된 영역, 유전자 조절 부위, 전사인자 결합 부위 등을 예측하는 데 활용됩니다. 또 DNA의 돌연변이가 생물학적으로 어떤 영향을 미칠 수 있는지도 예측할 수 있습니다.

특히 DNA의 작은 변화인 돌연변이는 사람마다 다른 특징을 만드는 데 영향을 줄 수 있고, 질병과도 관련될 수 있습니다. 논문에서는 GPN이나 DNABERT 계열 모델 등이 DNA 서열을 이용해 이러한 변이의 영향을 예측하는 데 활용되고 있다고 설명합니다.

## 연구 결과 ② RNA를 이해하고 만들어내는 AI

두 번째는 **전사체학**입니다. DNA의 정보는 RNA를 거쳐 단백질을 만드는 데 사용됩니다. RNA 역시 단순한 한 줄의 문자 정보가 아니라 복잡하게 접히면서 특정한 구조를 만들고 기능을 수행합니다.

RNA-FM, RNA-MSM, RNABERT, SpliceBERT 등의 모델은 RNA의 구조와 기능을 예측하거나 RNA가 어떻게 가공되는지를 분석하는 데 사용됩니다. 일부 생성형 모델은 원하는 특징을 가진 RNA 서열을 새롭게 만들어내는 데도 활용되고 있습니다.

예를 들어 SpliceBERT는 RNA가 잘려서 연결되는 과정인 ‘스플라이싱’과 관련된 변이를 분석할 수 있습니다. 이런 기술은 어떤 유전적 변화가 RNA의 정상적인 처리 과정에 영향을 주는지 이해하는 데 도움을 줄 수 있습니다.

## 연구 결과 ③ 단백질의 모양과 기능을 예측하다

세 번째는 **단백질체학**입니다. 단백질은 우리 몸에서 매우 중요한 일을 합니다. 그런데 단백질은 단순히 아미노산이 일렬로 연결된 것이 아니라 복잡한 3차원 구조를 가지고 있습니다. 이 구조가 어떻게 만들어지는지 아는 것은 단백질의 기능을 이해하는 데 매우 중요합니다.

이 분야에서 대표적인 사례가 **AlphaFold**입니다. 논문에서는 AlphaFold에서 AlphaFold2, AlphaFold3로 발전하면서 단백질 구조 예측 능력이 크게 발전해 왔다고 설명합니다. 특히 AlphaFold3는 단백질뿐 아니라 핵산, 작은 분자 등 여러 생체분자가 함께 이루는 복잡한 구조와 상호작용을 예측하는 방향으로 발전했습니다.

또한 AI는 기존 단백질의 구조를 예측하는 것에서 그치지 않고 새로운 단백질 서열을 만들어내는 데에도 활용되고 있습니다. ProtGPT2, ZymCTRL, ProGen 같은 모델은 특정 특성을 가진 단백질이나 효소를 설계하는 데 사용될 가능성을 보여주고 있습니다.

## 연구 결과 ④ 신약개발에도 활용

네 번째는 **신약개발**입니다. 새로운 약을 만들기 위해서는 수많은 화합물을 조사하고 어떤 물질이 특정 단백질과 잘 결합하는지 확인해야 합니다. 전통적인 방법만으로 이 과정을 모두 수행하면 많은 시간과 비용이 필요합니다.

AI 기반모델은 화합물의 특성을 예측하거나 새로운 약물 후보 물질을 만들어내고, 약물과 표적 단백질의 상호작용을 예측하는 데 활용되고 있습니다.

예를 들어 SMILES-BERT와 X-MOL은 분자의 구조를 학습해 분자의 특성을 예측하고, MolGPT나 Pocket2Mol, PMDM 등은 새로운 분자를 생성하는 데 활용됩니다. 이러한 기술은 신약 후보를 찾는 초기 단계의 탐색을 빠르게 하는 데 도움을 줄 수 있습니다.

다만 AI가 새로운 약물 후보를 만들어냈다고 해서 바로 실제 치료제가 되는 것은 아닙니다. 논문 역시 컴퓨터가 예측한 결과를 실제 화학적·생물학적 실험으로 충분히 검증해야 한다는 점을 중요한 과제로 제시합니다.

## 연구 결과 ⑤ 한 개의 세포도 자세히 분석한다

다섯 번째는 **단일세포 분석**입니다. 예전에는 많은 세포를 한꺼번에 분석하는 경우가 많았지만, 최근에는 세포 하나하나의 유전자 활동을 분석할 수 있게 되었습니다.

이 기술을 이용하면 같은 조직 안에서도 서로 다른 종류의 세포가 어떤 특징을 가지고 있는지 확인할 수 있습니다. scGPT, scBERT, scFoundation, scTranslator, DeepMAPS, GLUE 등의 모델은 세포 유형을 분류하고, 비슷한 세포들을 묶고, 여러 종류의 생물학적 데이터를 통합하는 데 활용되고 있습니다.

특히 서로 다른 종류의 ‘오믹스’ 데이터를 합쳐 분석하는 **멀티오믹스 분석**은 중요한 발전 방향입니다. 유전자 발현뿐 아니라 DNA의 상태, 단백질 정보 등 여러 정보를 함께 살펴보면 세포가 어떻게 작동하는지 더욱 입체적으로 이해할 수 있기 때문입니다.

## 고찰: AI가 똑똑해질수록 확인해야 할 것도 많다

이 논문이 중요한 이유는 AI의 장점만 이야기하지 않는다는 데 있습니다. 기반모델은 많은 데이터를 빠르게 처리하고 다양한 문제에 적용할 수 있지만, 해결해야 할 문제도 분명히 존재합니다.

첫 번째는 **설명 가능성**입니다. AI가 “이 결과가 맞다”고 말하는 것만으로는 충분하지 않습니다. 왜 그런 결과가 나왔는지 과학자가 이해할 수 있어야 합니다. 특히 신약개발처럼 실제 생명과 건강에 영향을 줄 수 있는 분야에서는 AI의 판단을 실험적으로 확인하는 과정이 중요합니다.

두 번째는 **환각(hallucination)** 문제입니다. AI가 실제 데이터에 근거하지 않은 내용을 그럴듯하게 만들어낼 수 있다는 것입니다. 논문은 생명과학 분야에서도 이러한 문제가 발생할 수 있으며, 현재의 환각 탐지 방법도 정확성·속도·비용을 동시에 만족시키는 데 어려움이 있다고 설명합니다.

세 번째는 **데이터의 중요성**입니다. AI의 성능은 학습하는 데이터와 밀접하게 연결되어 있습니다. 논문에서는 TCGA, GEO, UniProt, PDB, ChEMBL, PubChem, Human Cell Atlas 등 다양한 생물학 데이터베이스가 기반모델 학습과 활용에 사용되고 있음을 보여줍니다. 결국 좋은 AI를 만들기 위해서는 양이 많은 데이터뿐 아니라 정확하고 신뢰할 수 있는 생물학적 데이터가 필요합니다.

## 의의와 시사점

이 연구가 보여주는 가장 큰 변화는 생명과학 AI가 **‘한 가지 문제만 푸는 도구’에서 ‘여러 생물학적 문제에 활용할 수 있는 공통 기반’으로 발전하고 있다는 것**입니다.

과거에는 DNA 분석용 AI, 단백질 분석용 AI, 약물 분석용 AI를 각각 따로 만드는 방식이 중심이었다면, 기반모델은 방대한 데이터를 먼저 학습하고 이후 필요한 문제에 맞게 추가 학습하는 방향으로 발전하고 있습니다. 논문은 이러한 흐름이 유전체, RNA, 단백질, 신약, 단일세포 분석을 서로 연결하는 데 중요한 역할을 할 수 있다고 설명합니다.

## 이 연구가 왜 중요한가?

이 연구가 중요한 이유는 **AI가 생명과학 연구의 속도와 범위를 바꿀 가능성을 한눈에 보여주기 때문**입니다.

DNA의 작은 변이를 찾고, RNA의 구조를 예측하고, 단백질의 3차원 구조를 알아내고, 새로운 약물 후보를 만들고, 세포 하나하나의 특징을 분석하는 일은 서로 다른 연구처럼 보입니다. 하지만 이 논문은 이 모든 영역에서 대규모 AI 모델이 활용되고 있다는 사실을 보여줍니다.

특히 중요한 점은 AI가 단순히 기존 데이터를 정리하는 역할을 넘어 **새로운 단백질이나 RNA, 약물 후보 물질을 만들어내는 단계까지 발전하고 있다는 것**입니다. 따라서 앞으로의 생명과학 연구에서는 실험실에서 얻은 데이터와 AI가 찾아낸 예측을 서로 연결하는 과정이 더욱 중요해질 것으로 볼 수 있습니다.

그러나 AI의 예측을 그대로 믿는 것이 아니라, **좋은 데이터를 사용하고, AI가 왜 그런 결과를 냈는지 확인하며, 실제 실험으로 검증하는 과정**이 반드시 함께 이루어져야 합니다. 이 논문이 말하는 바이오인포매틱스 기반모델의 진정한 가치는 AI가 과학자를 대신하는 데 있는 것이 아니라, 사람이 기존에는 분석하기 어려웠던 엄청난 양의 생물학적 정보를 이해하고 새로운 연구 아이디어를 찾도록 돕는 데 있다고 볼 수 있습니다.

결국 이 연구는 **AI와 생명과학의 결합이 이제 시작 단계가 아니라 실제 연구 현장에서 활용되는 중요한 흐름이 되었으며, 앞으로는 정확성·설명 가능성·검증 가능성을 갖춘 AI를 만드는 것이 핵심 과제가 될 것**임을 보여줍니다.


grok

바이오인포매틱스에 등장한 거대한 AI 모델들, 쉽게 알아보기

요즘 인공지능이 우리 일상 곳곳에 스며들고 있어요. 특히 생명과학 분야에서도 큰 변화가 일어나고 있답니다. 오늘은 ‘기초 모델(Foundation Model)’이라는 커다란 AI가 생물 정보를 어떻게 다루는지 소개한 최근 논문을 바탕으로, 일반인들도 쉽게 이해할 수 있게 풀어볼게요.

연구 배경을 먼저 살펴보면, 예전에는 과학자들이 DNA나 단백질 같은 생물 데이터를 분석할 때 하나하나 규칙을 직접 만들어야 했어요. 실험 비용도 많이 들고 시간도 오래 걸렸죠. 그런데 최근에 등장한 기초 모델은 엄청난 양의 데이터를 미리 학습한 뒤, 여러 가지 문제에 바로 적용할 수 있는 만능 도구처럼 쓰입니다. 마치 많은 책을 읽은 사람이 새로운 문제를 빨리 푸는 것과 비슷해요. 논문에서는 이런 모델들이 유전체(게놈), 전사체(RNA), 단백질, 신약 개발, 단일 세포 분석 등 다섯 가지 주요 분야에서 어떻게 쓰이는지 정리했습니다.

연구의 목적은 간단합니다. 과학자들이 어떤 기초 모델을 선택해야 할지 쉽게 알 수 있도록, 언어 모델, 영상 모델, 그래프 모델, 여러 데이터를 함께 다루는 멀티모달 모델로 나눠서 최근 성과를 소개하는 거예요. 특히 실험이 어렵고 비용이 많이 드는 생명과학에서, 이미 학습된 모델을 살짝만 조정해 쓰는 방법이 얼마나 효과적인지 보여주는 것이 핵심입니다.

방법은 기존에 발표된 여러 연구들을 체계적으로 모아서 비교하는 방식이었어요. 각 모델이 어떤 구조로 만들어졌는지, 얼마나 큰 데이터를 학습했는지, 실제 생물 문제에서 어떤 결과를 냈는지 표로 정리했습니다. 예를 들어 DNA 서열을 다루는 DNABERT, 단백질 구조를 예측하는 알파폴드, 세포 데이터를 분석하는 scGPT 같은 모델들이 등장하죠. 모델이 시간이 지나면서 어떻게 발전했는지 타임라인으로도 보여줍니다. 처음에는 특정 문제만 풀던 작은 모델에서 시작해, 지금은 여러 종류의 생물 데이터를 한꺼번에 이해하고 새로운 것을 만들어내기도 하는 단계까지 왔다는 점을 강조했어요.

결과 부분을 보면 흥미로운 점들이 많아요. 유전체 분야에서는 DNA 서열을 언어처럼 읽어 변이 효과나 조절 부위를 예측하는 모델들이 나왔습니다. 전사체에서는 RNA 구조를 예측하거나 스플라이싱 위치를 찾아내는 데 성공했고, 단백질 분야에서는 구조를 정확히 맞히거나 새로운 효소를 디자인하는 수준까지 올라갔어요. 신약 개발에서는 분자 특성을 예측하고 새로운 후보 물질을 만들어내며, 단일 세포 분석에서는 세포 종류를 구분하고 여러 옴스 데이터를 하나로 통합하는 데 큰 도움이 되고 있습니다. 특히 알파폴드3처럼 단백질과 다른 분자가 어떻게 결합하는지까지 예측하는 모델이 나와 구조생물학에 큰 변화를 가져왔다는 점이 눈에 띕니다.

고찰에서는 아직 해결해야 할 과제도 솔직하게 다룹니다. 모델이 너무 커서 왜 그런 답을 냈는지 설명하기 어렵다는 점, 가끔 사실이 아닌 내용을 만들어내는 ‘환각’ 현상, 평가 기준이 아직 통일되지 않은 점 등이 있습니다. 앞으로 더 나은 사전 학습 방법과 해석 가능한 모델, 정확한 평가 도구가 필요하다고 제안해요. 동시에 이런 모델들이 실제 실험과 결합되면 질병 연구나 신약 개발 속도가 훨씬 빨라질 것이라고 전망합니다.

이 연구가 가지는 의의와 시사점은 명확합니다. 복잡한 생명 현상을 컴퓨터가 더 잘 이해하게 되면, 개인 맞춤형 의료나 새로운 치료제 개발이 훨씬 쉬워질 수 있어요. 또한 과학자들이 모델 선택에 시간을 덜 들이고 바로 연구에 집중할 수 있게 도움을 줍니다. 더 나아가 AI와 생명과학이 만나는 지점에서 새로운 질문이 계속 생겨나고, 그 답을 찾아가는 과정 자체가 과학의 발전을 이끈다는 점도 중요합니다.

이 연구가 왜 중요할까요? 우리 몸은 DNA부터 세포 하나하나까지 모두 정보로 이뤄져 있어요. 그 정보를 AI가 제대로 읽기 시작하면, 질병의 원인을 더 빨리 찾고 필요한 약을 더 정확하게 만들 수 있게 됩니다. 실험실에서만 가능하던 일들이 컴퓨터로도 가능해지면서, 시간과 비용을 크게 줄이고 더 많은 사람들이 혜택을 받을 수 있는 길이 열리는 거죠. 결국 이 논문은 단순한 기술 소개를 넘어, 미래 의학과 생명과학이 어떻게 바뀔지 보여주는 이정표 역할을 합니다.


NotebookLM

안녕하세요! 컴퓨터로 생명체의 비밀을 풀고 인공지능(AI)을 활용해 질병 진단과 신약 개발을 연구해 온 생물정보학 박사이자 현장 전문가입니다.

오늘은 2025년 세계적인 학술지 **'네이처 사이언스 리뷰(National Science Review)'**에 발표된 논문을 바탕으로, 생명과학 분야에 불어닥친 대형 인공지능 혁신인 **'생물정보학 파운데이션 모델(Foundation Models in Bioinformatics)'**에 대한 이야기를 들려드리려 합니다.

**[블로그 포스팅] 생명체의 거대한 비밀번호를 푸는 인공지능 지도: 생물정보학 파운데이션 모델의 모든 것**

**1. 연구 배경: 왜 생물학 연구에 대형 인공지능(파운데이션 모델)이 필요할까요?**

우리가 생물체를 연구할 때는 세포 하나, 유전자 하나를 실험실에서 직접 확인해야 하는데, 이 과정은 비용도 많이 들고 시간과 노력이 엄청나게 들어갑니다. 과거의 컴퓨터 알고리즘이나 인공지능은 사람이 일일이 만든 단순한 규칙이나 한 가지 특정 임무에만 의존하여 복잡한 생명 현상을 넓게 이해하는 데 한계가 있었습니다. 하지만 최근 챗GPT처럼 수많은 데이터를 미리 스스로 공부한 뒤 여러 문제에 똑똑하게 응용되는 **'파운데이션 모델(Foundation Model)'**이 등장하면서 생물학 연구의 판도가 완전히 바뀌게 되었습니다.

**2. 연구 목적: 흩어져 있던 생물학 인공지능 모델들의 '통합 지도' 만들기**

이 연구의 목적은 전 세계 연구진이 개발한 수많은 생물정보학 파운데이션 모델들을 4가지 AI 기술 형태(언어, 비전, 그래프, 다중위계/멀티모달)와 5가지 핵심 생물학 연구 분야(유전체, 전사체, 단백질체, 신약 개발, 단일세포 분석)로 정밀하게 분류하고 종합적인 체계를 세우는 것이었습니다. 과학자들이 자신의 연구 목적에 꼭 맞는 인공지능 도구를 쉽게 선택할 수 있도록 돕고, 앞으로 인공지능 생물학이 나아가야 할 방향을 제시하고자 했습니다.

**3. 연구 방법: 방대한 데이터베이스와 인공지능 구조의 체계적 분석**

연구진은 DNA, RNA, 단백질, 약물 분자, 단일세포 오믹스 등 생물학 전반에 걸친 방대한 빅데이터와 주요 생물학 데이터베이스(TCGA, GEO, UniProt, PDB, ChEMBL, Human Cell Atlas 등)를 수집했습니다. 그리고 인공지능 모델들을 글자를 이해하는 '언어 모델(BERT, GPT 등)', 이미지를 읽는 '비전 모델(CNN, VQ-VAE 등)', 분자 구조와 관계를 분석하는 '그래프 모델(GNN, Graphormer 등)', 그리고 여러 형태의 데이터를 한 번에 처리하는 '멀티모달 모델(CLIP, GLUE 등)'로 체계적으로 구분해 사전 학습 방법과 활용 결과를 종합 분석했습니다.

**4. 주요 연구 결과: 5대 생물학 분야에서 거둔 인공지능의 놀라운 성과**

파운데이션 모델은 생명과학의 5가지 핵심 분야에서 놀라운 능력을 증명해 냈습니다.

첫째, **유전체(Genomics)**: DNABERT, HyenaDNA, Evo 같은 모델들은 복잡한 DNA 암호를 마치 인간의 언어처럼 읽어내어, 유전자 작동을 조절하는 스위치(프로모터, 인핸서)나 DNA 오타(변이)가 질병에 미치는 영향을 정밀하게 예측합니다.

둘째, **전사체(Transcriptomics)**: RNABERT, RNA-FM, GenerRNA 등은 RNA의 복잡한 3차원 접힘 구조와 스플라이싱 현상, 세포 내 변화를 분석하고 원하는 기능을 가진 RNA를 스스로 만들어냅니다.

셋째, **단백질체(Proteomics)**: AlphaFold(1, 2, 3), ESM2, ProGen 같은 혁신적 모델들은 단백질의 입체 구조와 다른 분자와의 결합 모양을 정확히 예측하고, 원하는 기능을 가진 인공 단백질 및 효소를 설계해 냅니다.

넷째, **신약 개발(Drug Discovery)**: SMILES-BERT, Mole-BERT, Pocket2Mol 등은 약물 분자의 화학적 성질과 독성을 예측하고, 암이나 질병 표적 단백질에 딱 들어맞는 3차원 맞춤형 신약 후보 물질을 자동 생성합니다.

다섯째, **단일세포 분석(Single-cell Analysis)**: scGPT, scBERT, scFoundation, GLUE 등은 수만 개의 세포 하나하나의 유전자 정보를 읽어 세포 종류를 알아내고, 복잡한 생체 반응과 다중 오믹스 데이터를 하나로 통합 분석합니다.

**5. 고찰: 미래의 인공지능 생물학이 풀어야 할 4가지 숙제**

연구진은 파운데이션 모델이 엄청난 성능을 보여주지만, 해결해야 할 중요한 한계점들도 명확히 짚어냈습니다. 첫째, 인공지능이 왜 그런 결과를 내놓았는지 원인을 설명할 수 있는 **'설명 가능성(Explainability)'**을 높이기 위해 지식 그래프와 인과 추론 기술이 결합되어야 합니다. 둘째, 인공지능이 거짓 정보를 그럴듯하게 만들어내는 **'환각 현상(Hallucination)'**을 잡아내는 정밀한 검증 도구(Luna 등)가 필요합니다. 셋째, 악의적인 사용자가 공개 데이터에 가짜 신호를 넣어 AI를 속이는 **'보안 공격(Backdoor attack)'**에 대비해야 합니다. 넷째, 모델에게 올바른 지침을 주는 '프롬프트 학습(Prompt learning)'과 대규모 평가 시스템(UltraEval)을 계속 발전시켜야 합니다.

**6. 의의와 시사점: 실험실의 한계를 넘어서는 '생명과학 4.0'의 시작**

이번 연구는 단순한 개별 예측에 머물던 과거 컴퓨터 생물학을 넘어, 수억 개의 데이터를 스스로 학습한 대형 인공지능이 생명체의 정교한 시스템 전체를 이해하고 새로운 단백질이나 약물까지 직접 만들어낼 수 있음을 명확히 증명했습니다. 이는 생물학 연구를 수동 실험 중심에서 데이터 중심의 예측 및 생성 과학으로 바꾸어 놓는 거대한 패러다임 전환입니다.

**💡 이 연구가 왜 중요한가요?**

이 연구가 소중한 진짜 이유는 **"난치병 극복과 신약 개발의 시간을 획기적으로 줄여줄 '인공지능 나침반'을 완성했기 때문"**입니다. 옛날에는 새로운 치료제 하나를 만들려면 수천 번의 실험을 하며 수년의 시간과 수조 원의 비용을 써야 했습니다. 하지만 파운데이션 모델이라는 똑똑한 AI 조수가 생명체의 설계도인 DNA, RNA, 단백질을 순식간에 분석하고 맞춤형 약물을 디자인해 줌으로써, 우리가 희귀 질환이나 암 같은 무서운 병을 더 빨리 진단하고 치료할 수 있는 기틀이 마련되었습니다. 결국 이 연구는 미래의 정밀 의료 시대를 앞당겨 인류가 더 건강하게 살 수 있도록 돕는 가장 강력하고 정교한 지식의 등대가 되어준다는 점에서 매우 큰 가치를 지닙니다.


Perplexity.ai

# 생명과학 연구를 바꾸는 인공지능, 바이오인포매틱스 기반 모델

최근 인공지능은 글을 쓰거나 사진을 인식하는 수준을 넘어 생명과학 연구에도 빠르게 활용되고 있습니다. 특히 방대한 생물학 데이터를 미리 학습한 ‘기반 모델(Foundation Model)’은 DNA, RNA, 단백질, 신약 후보 물질, 세포 데이터를 분석해 질병 연구와 신약 개발을 돕고 있습니다. 이 글은 생명정보학 분야의 기반 모델을 정리한 연구 논문을 바탕으로, 인공지능이 생명과학 연구에서 어떤 역할을 하는지 쉽게 설명한 내용입니다.

## 연구 배경

우리 몸속의 생명현상은 DNA, RNA, 단백질 같은 분자들의 복잡한 작용으로 이루어집니다. DNA에는 유전 정보가 저장되어 있고, RNA는 그 정보를 전달하며, 단백질은 실제로 세포 안에서 다양한 일을 수행합니다. 그러나 이 분자들의 정보량은 매우 많고 구조도 복잡하기 때문에 사람이 직접 모두 분석하기는 어렵습니다.

예를 들어 DNA의 염기서열은 매우 긴 글과 비슷합니다. 단백질은 수많은 아미노산이 특정한 방식으로 접혀 만들어지며, 약물은 특정 단백질과 결합해야 효과를 나타냅니다. 이러한 관계를 이해하려면 엄청난 양의 실험과 계산이 필요합니다. 하지만 생물학 실험은 시간과 비용이 많이 들고, 모든 데이터를 사람이 직접 확인하기도 어렵습니다.

이런 문제를 해결하기 위해 등장한 것이 기반 모델입니다. 기반 모델은 많은 데이터를 미리 공부한 뒤, 새로운 문제를 해결하는 인공지능입니다. 사람으로 비유하면 여러 분야의 책을 먼저 읽고, 이후 특정 과목의 문제를 풀 수 있도록 훈련하는 방식입니다. 연구자들은 DNA·RNA·단백질 서열과 세포 데이터를 기반 모델에 학습시킨 뒤, 유전자 기능 예측이나 단백질 구조 분석 같은 다양한 작업에 활용하고 있습니다.

## 연구 목적과 방법

이 논문은 생명정보학에 활용되는 기반 모델의 발전과 활용 현황을 종합적으로 정리한 연구입니다. 단순히 하나의 인공지능 모델을 소개한 것이 아니라, 어떤 종류의 모델이 어떤 생물학적 문제에 적합한지를 폭넓게 살펴보았습니다.

연구진은 기반 모델을 크게 네 종류로 나누었습니다.

- 언어 기반 모델: DNA, RNA, 단백질처럼 순서가 있는 데이터를 ‘생물학의 언어’로 보고 분석합니다.

- 시각 기반 모델: 분자 구조나 세포 이미지처럼 형태와 공간 정보를 분석합니다.

- 그래프 기반 모델: 분자와 분자 사이의 연결, 유전자와 세포 사이의 관계를 분석합니다.

- 다중정보 기반 모델: DNA, RNA, 단백질, 임상정보처럼 서로 다른 종류의 데이터를 함께 분석합니다.

또한 활용 분야를 유전체학, 전사체학, 단백질체학, 신약 개발, 단일세포 분석의 다섯 영역으로 나누어 대표적인 모델과 기능을 정리했습니다. 연구진은 각 모델이 어떤 데이터를 학습했는지, 어떤 구조를 사용하는지, 실제로 어떤 예측이나 생성 작업에 이용되는지도 함께 검토했습니다.

## 주요 결과

### DNA에서 질병 관련 변이를 찾다

유전체학에서는 DNABERT, DNABERT-2, Nucleotide Transformer, HyenaDNA, Evo와 같은 모델이 소개되었습니다. 이 모델들은 DNA 염기서열을 문장처럼 읽고, 그 안에 포함된 중요한 패턴을 찾아냅니다.

이를 통해 유전자의 작동을 조절하는 프로모터와 인핸서 영역, 전사인자가 결합하는 위치, 유전자 발현에 영향을 주는 DNA 변이 등을 예측할 수 있습니다. 특히 GPN과 같은 모델은 흔하지 않은 유전 변이가 생물학적으로 어떤 영향을 미칠지 예측하는 데 활용될 수 있습니다.

쉽게 말하면, DNA에서 글자 하나가 바뀌었을 때 그 변화가 단순한 차이인지, 아니면 질병 위험이나 신체 기능에 영향을 줄 수 있는 중요한 변화인지를 인공지능이 찾아내는 것입니다.

### RNA의 구조와 작동 방식을 분석하다

RNA는 DNA의 정보를 전달하는 역할뿐 아니라, 스스로 접혀 특정한 구조를 만들고 다양한 기능을 수행합니다. 따라서 RNA의 염기서열뿐 아니라 어떤 모양으로 접히는지도 중요합니다.

RNA-FM, RNA-MSM, RNABERT와 같은 모델은 RNA의 2차 구조와 기능을 예측하고, 아직 잘 알려지지 않은 RNA의 역할을 추정하는 데 이용됩니다. SpliceBERT는 RNA가 잘라지고 이어지는 과정인 스플라이싱을 분석해, 특정 유전 변이가 RNA 처리 과정에 어떤 문제를 일으킬지 예측하는 데 도움을 줍니다.

또한 GenerRNA와 RfamGen은 원하는 특성을 가진 새로운 RNA 서열을 설계하는 데 활용될 가능성을 보여주었습니다. 이는 향후 RNA 치료제나 생명공학용 RNA를 개발하는 데 중요한 기술이 될 수 있습니다.

### 단백질의 모양과 기능을 예측하다

단백질은 아미노산이 길게 연결된 물질이지만, 실제 기능은 이 사슬이 어떤 입체적인 모양으로 접히느냐에 따라 달라집니다. 단백질 구조를 알아내기 위해서는 오랜 시간과 많은 실험이 필요했지만, 인공지능은 이 과정을 크게 빠르게 만들었습니다.

AlphaFold 계열 모델은 단백질의 3차원 구조를 예측하는 데 큰 발전을 가져왔습니다. 특히 AlphaFold3는 단백질뿐 아니라 DNA·RNA·작은 분자·항체 등이 서로 어떻게 결합하는지까지 예측하는 방향으로 발전했습니다. 이를 통해 단백질이 다른 분자와 어떻게 상호작용하는지 파악할 수 있습니다.

ESM2, ProtTrans, ProteinBERT와 같은 단백질 언어 모델은 단백질의 기능, 안정성, 구조, 진화적 관계 등을 예측합니다. ProtGPT2, ProGen, ZymCTRL 같은 모델은 특정 기능을 가질 가능성이 있는 새로운 단백질이나 효소 서열을 만들어내는 데도 활용됩니다.

### 신약 후보 물질을 더 빠르게 찾다

신약 개발에는 수많은 후보 물질을 조사하고, 그 물질이 효과가 있는지, 독성이 있는지, 몸속에서 잘 흡수되는지 확인하는 과정이 필요합니다. 기존에는 이 과정을 실험 중심으로 진행했지만, 인공지능을 이용하면 실험 전에 후보 물질을 가상으로 선별할 수 있습니다.

SMILES-BERT, X-MOL, Mole-BERT, KPGT 등은 화학물질의 구조를 학습해 약물의 특성을 예측합니다. 예를 들어 특정 물질이 물에 잘 녹는지, 몸에 흡수될 가능성이 있는지, 독성이 있을지 등을 미리 추정할 수 있습니다.

MolGPT, Pocket2Mol, PMDM은 원하는 특성을 가진 새로운 분자를 만들어내는 모델입니다. 단백질의 특정 부위에 잘 결합할 수 있는 약물 후보를 설계하거나, 여러 표적을 동시에 조절하는 분자를 찾는 데도 이용됩니다. 이 과정은 신약 개발 초기 단계에서 수많은 후보 물질을 빠르게 줄이는 데 도움이 될 수 있습니다.

### 한 개의 세포를 자세히 들여다보다

단일세포 분석은 세포 하나하나의 유전자 활동을 조사하는 기술입니다. 같은 조직 안에 있는 세포라도 종류와 상태가 서로 다를 수 있기 때문에, 세포 단위의 분석은 암이나 면역질환 연구에서 특히 중요합니다.

scGPT, scBERT, scFoundation과 같은 모델은 세포를 종류별로 분류하고, 비슷한 세포끼리 묶으며, 유전자 사이의 조절 관계를 추정하는 데 사용됩니다. scButterfly와 scTranslator는 유전자 발현 정보와 단백질 정보를 연결하거나, 부족한 데이터를 보완하는 역할을 합니다.

GLUE와 DeepMAPS 같은 모델은 DNA 접근성, 유전자 발현, 단백질 정보 등 여러 종류의 데이터를 함께 분석합니다. 이를 통해 어떤 유전자가 세포의 특성을 결정하는지, 질병 세포가 정상 세포와 어떻게 다른지 더 종합적으로 파악할 수 있습니다.

## 고찰과 한계

이 연구가 보여주는 가장 큰 변화는 인공지능이 단순한 예측 도구를 넘어 생물학적 지식을 여러 문제에 재사용할 수 있는 기반이 되고 있다는 점입니다. 예전에는 각각의 문제마다 별도의 인공지능을 새로 만들어야 했지만, 기반 모델은 대규모 데이터를 미리 학습한 뒤 적은 양의 추가 학습만으로 여러 작업에 적용할 수 있습니다.

그러나 인공지능의 예측이 항상 정답이라는 뜻은 아닙니다. 학습 데이터가 부족하거나 특정 생물종과 인구집단에 치우쳐 있으면 결과가 부정확할 수 있습니다. 또한 인공지능이 왜 그런 결론을 내렸는지 설명하기 어려운 경우도 많습니다.

특히 신약 후보 물질이나 새로운 단백질을 인공지능이 만들어냈다고 해서 곧바로 실제 치료제가 되는 것은 아닙니다. 실험을 통해 효과와 안전성을 반드시 확인해야 합니다. 논문은 인공지능이 그럴듯하지만 사실이 아닌 결과를 만들어내는 ‘환각’ 현상도 중요한 문제로 지적합니다. 따라서 결과를 그대로 믿기보다 실제 생물학적 지식, 실험 결과, 전문가의 검토를 함께 사용해야 합니다.

## 의의와 시사점

이 연구는 생명정보학 기반 모델을 DNA, RNA, 단백질, 신약, 단일세포라는 주요 분야별로 정리하고, 각 분야에 어떤 인공지능이 활용되는지 한눈에 보여주었다는 데 의의가 있습니다. 연구자들은 이 자료를 바탕으로 자신이 해결하려는 문제에 적합한 모델을 선택할 수 있습니다.

앞으로는 서로 다른 생물학 데이터를 한꺼번에 이해하는 다중정보 기반 모델이 더욱 중요해질 것으로 보입니다. DNA의 변화가 RNA에 어떤 영향을 주고, 그 결과 단백질과 세포의 기능이 어떻게 달라지는지 연결해서 분석할 수 있기 때문입니다. 또한 인공지능의 판단 근거를 설명하고, 다양한 생물학적 조건에서 성능을 공정하게 평가하는 기술도 함께 발전해야 합니다.

## 이 연구가 중요한 이유

이 연구가 중요한 이유는 생명과학 연구의 속도와 범위를 크게 넓힐 수 있는 인공지능의 현재 모습을 체계적으로 보여주기 때문입니다. 지금까지는 질병의 원인을 찾고 신약을 개발하기 위해 많은 시간과 비용이 필요했습니다. 기반 모델은 방대한 생물학 데이터를 빠르게 분석해 연구자가 주목해야 할 유전자, 단백질, 약물 후보를 먼저 찾아줄 수 있습니다.

다만 인공지능은 과학자를 대신하는 도구라기보다, 과학자의 판단을 돕는 강력한 연구 보조수단에 가깝습니다. 인공지능의 예측과 실제 실험이 함께 이루어질 때, 질병의 원인을 더 정확히 이해하고 환자에게 필요한 치료법을 더 빠르게 찾을 수 있습니다. 결국 이 연구는 인공지능과 생명과학의 결합이 미래 의학과 신약 개발의 중요한 기반이 될 수 있음을 보여줍니다. 


Kimi

# 인공지능이 생명의 언어를 배우기 시작했다 — 논문 리뷰: 생물정보학의 파운데이션 모델

## 연구 배경: 왜 생물학에 인공지능이 필요한가

우리 몸은 수십억 개의 세포로 이루어져 있고, 각 세포에는 DNA라는 설계도가 들어 있습니다. 이 DNA는 문자 그대로 네 가지 글자(A, T, G, C)로 쓰여 있는데, 사람의 경우 이 글자가 무려 30억 자나 됩니다. 여기에 단백질의 구조, 약물 분자의 모양, 수많은 세포 하나하나의 활동 기록까지 더하면, 생명과학이 다뤄야 할 정보의 양은 상상을 초월합니다.

문제는 이런 데이터를 실험으로 하나하나 확인하는 데 엄청난 시간과 비용이 든다는 것입니다. 그래서 과학자들은 오래전부터 "컴퓨터로 생명의 비밀을 풀 수 없을까?"라는 질문을 해왔고, 그 결과 태어난 분야가 바로 생물정보학입니다. 그런데 최근 이 분야에 큰 변화가 찾아왔습니다. ChatGPT 같은 대규모 인공지능 모델이 사람의 언어를 이해하듯, 생명체도 사실 '언어'로 기록되어 있다는 사실을 알게 된 것입니다. DNA는 유전자의 언어, RNA는 그 언어의 필사본, 단백질은 기능을 수행하는 문장, 약물 분자는 화학의 언어로 쓰여 있습니다. 이 논문은 바로 이 생명의 언어를 대규모 인공지능, 즉 '파운데이션 모델(Foundation Model)'로 해석하려는 최신 연구 동향을 정리한 리뷰 논문입니다.

## 연구 목적: 거대 모델의 지도를 그리다

이 논문의 목적은 명확합니다. 지난 몇 년 사이 수십 개의 생물정보학 파운데이션 모델이 쏟아져 나왔는데, 연구자들이 자신의 연구 과제에 어떤 모델을 골라 써야 할지 갈피를 잡기 어려운 상황이었기 때문입니다. 저자들은 모델을 크게 네 가지 유형(언어 모델, 시각 모델, 그래프 모델, 멀티모달 모델)으로 분류하고, 다섯 가지 연구 분야(게놈, 트랜스크립톰, 프로테옴, 신약 개발, 단세포 분석)별로 각각 어떤 모델이 어떤 일을 하는지 체계적으로 정리했습니다. 마지막으로 앞으로의 과제와 가능성까지 전망했습니다.

## 연구 방법: 일단 잔뜩 읽고, 분류하고, 정리하다

구체적인 실험을 새로 한 연구라기보다, 이 분야의 최신 성과를 폭넓게 분석한 종합 리뷰 논문입니다. 저자들은 100편이 넘는 최신 논문을 분석해 모델의 학습 방식, 매개변수 규모, 사용된 생물학 데이터베이스, 그리고 실제 적용 과제를 표와 그림으로 정리했습니다. 특히 모델들의 발전 과정을 시간순으로 추적해 보여주는데, 2020년 첫 등장 이후 2024년까지 얼마나 폭발적으로 성장했는지 한눈에 볼 수 있도록 구성한 점이 인상적입니다.

## 연구 결과: 생명의 언어를 읽는 네 가지 방법

결과를 쉽게 설명하자면, 인공지능이 생명의 언어를 배우는 방법이 네 가지로 나뉜다는 것입니다.

첫째, 언어 모델입니다. 글자가 이어진 것을 문장처럼 읽는 방식으로, 대표적으로 DNABERT가 있습니다. 이 모델은 DNA 서열을 입력하면 어디서 유전자가 시작되는지(프로모터 예측), 어디가 스플라이싱 지점인지 등을 찾아냅니다. HyenaDNA는 긴 서열을 한 번에 처리하고, Evo는 최대 70억 개의 매개변수로 미생물 유전체 전체를 다루는 거대 모델입니다. RNA 분야에서는 RNA-FM이 2차 구조를 예측하고, SpliceBERT가 RNA 가위질 지점을 찾아냅니다. 단백질에서는 ESM2가 무려 150억 개의 매개변수로 단백질 언어를 읽어 접촉 지점을 예측했고, ProtGPT2는 자연의 원리를 배워 아예 새로운 단백질 서열을 만들어냅니다. 약물 분야에서는 SMILES-BERT와 X-MOL이 화학 구조를 읽어 약물 성질을 예측합니다. 단세포 분석에서는 scGPT와 scFoundation이 각 세포의 유전자 발현 패턴을 읽어 세포 유형을 자동으로 분류합니다.

둘째, 시각 모델입니다. 생물학 데이터를 이미지처럼 다루는 방식으로, VQDNA는 유전체 토큰화를 이미지 압축 기술처럼 처리하고, RfamGen은 RNA 가족 서열을 생성합니다.

셋째, 그래프 모델입니다. 분자를 원자(점)와 결합(선)의 그래프로 표현해 관계를 학습하는 방식입니다. Mole-BERT와 MolCLR이 약물 분자의 특성을 예측하고, Pocket2Mol은 단백질 주머니(pocket)에 맞는 약물 분자를 3D로 생성합니다. 단세포에서는 DeepMAPS와 SiGra가 세포와 유전자의 관계 네트워크를 그래프로 그립니다.

넷째, 멀티모달 모델입니다. 여러 종류의 데이터를 함께 다루는 최신 방식으로, AlphaFold3가 대표적입니다. AlphaFold3는 아미노산, 핵산, 작은 분자까지 포함한 복합체의 3D 구조를 예측하며, 확산 모듈을 이용해 원자 좌표를 직접 추정합니다. MoleculesSTM은 화학 구조와 텍스트를 함께 학습하고, GLUE는 서로 다른 오믹스 데이터를 통합해 유전자 조절 관계를 추론합니다.

특히 주목할 결과는 AlphaFold 시리즈의 발전입니다. 2020년 AlphaFold가 단백질 구조 예측에서 혁명을 일으킨 뒤, AlphaFold2가 공간적·진화적 관계를 직접 학습해 정확도를 크게 높였고, AlphaFold3는 MSA(다중 서열 정렬) 의존도를 줄이면서도 더 넓은 종류의 생체분자 복합체를 예측할 수 있게 되었습니다. 이는 "모델이 진화하며 이전 세대의 한계를 어떻게 극복하는가"를 보여주는 생생한 사례입니다.

## 고찰: 아직 풀지 못한 숙제들

저자들은 낙관만 하지 않고 과제도 분명히 짚었습니다. 첫째, 학습 데이터의 품질입니다. 인공지능은 데이터가 쓰레기면 쓰레기를 내놓기 때문에, TCGA, UniProt, PDB, ChEMBL 같은 생물학 데이터베이스의 표준화와 확충이 선행되어야 합니다. 둘째, 평가의 어려움입니다. 각 모델이 서로 다른 기준으로 성능을 주장해 실제로 어떤 모델이 낫다고 말하기 어렵기 때문에, UltraEval이나 scEval 같은 공정한 벤치마크 평가 체계가 필요합니다. 셋째, 설명 가능성입니다. 인공지능이 예측은 잘해도 "왜 그런지"를 설명하지 못하면 실험실과 임상에서 신뢰받기 어렵습니다. 지식 그래프나 인과 추론 기법이 이 문제를 해결할 가능성이 있으며, 특히 신약 개발에서는 생성된 분자의 실제 화학·생물학적 실험 검증이 부족하다는 점을 지적했습니다. 넷째, 할루시네이션, 즉 사실이 아닌 내용을 지어내는 문제입니다. 생명과학에서 잘못된 예측은 인명과 직결될 수 있어, Luna 같은 환각 탐지 기술의 발전이 시급합니다. 나아가 scBackdoor 연구에서 보듯 단세포 사전학습 모델에 대한 백도어 공격 가능성까지, 보안 문제도 새로운 도전 과제로 떠올랐습니다.

## 의의와 시사점: 도구 상자가 열리다

이 논문의 가장 큰 의의는 생명과학 연구의 '작업 방식' 자체를 바꾸고 있다는 점입니다. 예전에는 한 가지 과제를 해결하려면 그 과제 전용 모델을 처음부터 만들어야 했지만, 이제는 거대 모델을 미리 학습시켜 두고(사전학습) 내가 풀고 싶은 문제에 살짝만 손을 봐서(파인튜닝) 해결하는 시대가 열렸습니다. 데이터가 적은 과제일수록 이 방식의 효과는 큽니다.

시사점은 분명합니다. 첫째, 연구자라면 "모델을 처음부터 만들지 말고, 먼저 잘 만들어진 파운데이션 모델을 활용할 수 있는지" 검토하는 습관이 필요합니다. 둘째, 프롬프트 학습과 대조 학습 같은 새로운 학습 전략(KANO, PromptProtein 등)이 성능과 해석력을 동시에 높이는 방향으로 진화 중이므로, 단순한 파인튜닝에 그치지 말아야 합니다. 셋째, 데이터·평가·해석·보안이라는 네 가지 인프라가 갖춰져야 파운데이션 모델의 진짜 가치가 나온다는 것입니다.

## 마치며: 왜 이 연구가 중요한가

이 연구가 중요한 이유는 간단합니다. 생명과학은 이제 데이터를 '모으는' 시대를 넘어 데이터를 '이해하는' 시대에 들어섰고, 그 이해의 열쇠를 파운데이션 모델이 쥐고 있기 때문입니다. 단백질 구조 예측에 드는 수십 년의 실험 시간을 몇 시간으로 줄이고, 신약 후보 물질을 컴퓨터에서 먼저 걸러내고, 우리 몸의 수많은 세포가 각각 무슨 일을 하는지 자동으로 해독할 수 있다면, 맞춤형 의료와 질병 치료의 속도는 상상 이상으로 빨라질 것입니다. 더 나아가 이 논문이 제시한 네 가지 모델 유형과 다섯 가지 적용 분야의 지도는, 전문 지식이 부족한 연구자와 일반인도 생명과학의 AI 혁명을 이해하는 좌표가 되어줍니다. 인공지능이 사람의 언어를 이해하며 세상을 바꿨듯, 생명의 언어를 이해하는 인공지능이 의학과 생명과학의 새 지평을 열고 있으며, 이 논문은 그 여정의 가장 정리된 안내서라 할 수 있습니다. 다만 기술이 아무리 뛰어나도 데이터 품질, 공정한 평가, 설명 가능성, 안전성이라는 기반이 함께 자라야 한다는 교훈도 함께 남깁니다.





출처: @ye._.vely618

월요일, 5월 25, 2026

스마트워치가 우리 일상을 읽고 건강을 미리 알려준다면?

요즘 스마트워치나 피트니스 밴드를 차고 다니는 분들이 정말 많아졌죠. 걸음 수, 심박수, 수면 시간을 매일 확인하면서 “오늘 컨디션이 어떤가”를 가늠해 보곤 합니다. 그런데 이 데이터들이 단순한 기록을 넘어, AI가 우리 건강 상태를 미리 예측하는 데까지 쓰일 수 있다면 어떨까요?  

오늘 가져온 연구는 바로 그 부분을 다뤘습니다. 제목은 Beyond Sensor Data: Foundation Models of Behavioral Data from Wearables Improve Health Predictions로, 애플 연구팀이 진행한 내용입니다. 기존에 주로 심박수 같은 순간 순간의 생체 신호에 집중했던 것과 달리, 사람들이 실제로 어떻게 움직이고 생활하는지 보여주는 ‘행동 데이터’를 대규모로 학습한 AI 모델을 만들었다고 하네요.  

약 16만 명이 넘는 사람들의 25억 시간 분량 데이터를 바탕으로 했고, 걸음 수, 활동량, 수면 패턴 등 27가지 지표를 활용했다고 합니다. 결과적으로 나이·성별 예측은 물론이고, 수면 문제나 임신 여부, 부상 같은 상황을 행동 패턴만으로도 꽤 잘 읽어내는 모습을 보였습니다. 특히 기존 센서 데이터와 함께 쓰니 더 좋은 성능이 나왔다고 해요.  

평소에 손목에 차고 다니는 기기가 우리 생활 패턴을 조용히 보고 있다가 건강 변화를 알려줄 수 있다는 게 흥미로웠습니다. 아래에 이번 연구 내용을 좀 더 자세히 정리해 보았어요. 편하게 읽어 보시고, 오늘 하루도 건강하게 보내세요.


DOI: 10.48550/arXiv.2507.00191


gemini

안녕하세요! 여러분의 건강을 책임지는 스마트워치, 단순한 운동 기록기를 넘어 우리의 건강을 예측하는 똑똑한 비서가 될 수 있을까요?

최근 발표된 흥미로운 연구 결과를 바탕으로, 우리의 일상적인 '행동' 데이터가 어떻게 질병을 예측하고 건강을 관리하는 데 도움을 줄 수 있는지 알기 쉽게 정리해 보았습니다. 

### 1. 연구 배경: 왜 센서 데이터만으로는 부족할까?

우리가 스마트워치를 찰 때 측정되는 데이터는 크게 두 가지입니다. 하나는 심박수나 혈중 산소 농도 같은 '생체 신호(Sensor Data)'이고, 다른 하나는 걸음 수, 수면 시간, 걷는 속도 같은 '행동 데이터(Behavioral Data)'입니다. 

기존의 인공지능 연구들은 주로 심박수 같은 생체 신호에 집중해 왔습니다. 하지만 생체 신호는 측정되는 순간의 상태는 잘 보여주지만, 우리 삶의 긴 흐름이나 구체적인 생활 습관을 보여주는 데는 한계가 있었습니다. 

### 2. 연구 목적: 행동의 패턴 속에 답이 있다!

연구팀은 "우리가 매일 어떻게 움직이고 어떻게 자는지"와 같은 '행동 패턴'이 건강 상태를 더 정확하게 반영할 수 있다는 점에 주목했습니다. 

예를 들어, 임신 중인 여성은 걷는 속도나 보폭, 활동량이 평소와 달라질 수 있습니다. 이번 연구의 목적은 이런 방대한 행동 데이터를 학습하여, 다양한 건강 상태와 질병을 미리 감지할 수 있는 인공지능 모델(WBM, Wearable Health Behavior Foundation Model)을 만드는 것이었습니다. 

### 3. 연구 방법: 16만 명의 데이터로 만든 거대 인공지능

연구팀은 '애플 심장 및 운동 연구(Apple Heart and Movement Study)'를 통해 수집된 약 16만 2천 명의 데이터를 활용했습니다. 이들의 데이터를 시간으로 환산하면 무려 25억 시간, 데이터 양으로는 150억 개에 달하는 엄청난 규모입니다. 

인공지능은 일주일 단위로 사람들의 걸음 수, 이동 거리, 심박수 변동, 수면 패턴 등 27가지의 행동 지표를 학습했습니다. 특히 데이터가 불규칙하거나 빠진 부분이 있어도 정확하게 분석할 수 있도록 최신 'Mamba-2'라는 인공지능 구조를 사용하여 성능을 극대화했습니다. 

### 4. 연구 결과: 인공지능이 맞춘 나의 건강 상태

학습된 모델을 57가지의 다양한 건강 관련 과제에 적용해 본 결과, 매우 놀라운 성능을 보였습니다. 

먼저, 행동 데이터만으로도 사용자의 나이와 성별을 매우 정확하게 추측해 냈습니다. 또한 수면 장애 예측이나 신체 부상 감지처럼 '움직임'과 밀접한 건강 상태에서는 기존의 심박수 기반 모델보다 더 뛰어난 성능을 보였습니다. 특히 임신 여부 예측의 경우, 심박수 데이터와 행동 데이터를 결합했을 때 정확도가 매우 높게 나타났습니다. 

### 5. 고찰 및 의의: '나'보다 나를 더 잘 아는 웨어러블

이 연구의 가장 큰 고찰은 "행동이 곧 건강의 거울"이라는 점을 과학적으로 증명했다는 것입니다. 단순히 심장이 빨리 뛰는 것보다, 언제 어떻게 움직였는지가 그 사람의 건강을 설명하는 데 더 풍부한 정보를 제공한다는 의미입니다. 

또한, 이 모델은 특정 질병 하나만 맞추도록 설계된 것이 아니라, 사람의 일반적인 행동 패턴을 통째로 이해하고 있어서 새로운 건강 문제가 생겨도 유연하게 적용될 수 있는 '기초 모델'로서의 의의가 큽니다. 

### 6. 시사점: 미래의 진료는 병원 밖에서 시작된다

이제 스마트워치는 단순히 운동 기록을 보여주는 도구를 넘어, 우리가 인지하지 못하는 미세한 행동 변화를 감지해 질병의 전조 증상을 알려주는 '조기 경보 시스템'이 될 수 있습니다. 

특히 병원에 자주 가기 힘든 분들이나, 매일의 컨디션 변화가 중요한 만성 질환자들에게 실시간으로 건강 인사이트를 제공할 수 있는 가능성을 열어주었습니다. 

### 이 연구가 왜 중요할까요?

이 연구가 중요한 이유는 우리의 **'평범한 일상'을 '귀중한 의료 정보'로 바꿨기 때문**입니다. 

과거에는 병원에 가서 검사를 받아야만 알 수 있었던 건강의 변화들을, 이제는 우리가 자고 걷는 일상 속에서 자연스럽게 파악할 수 있게 되었습니다. 이는 질병이 커진 뒤에 치료하는 '사후 약방문' 식의 의료에서 탈피하여, 일상에서 미리 관리하고 예방하는 **'예방 의료' 시대로 가는 중요한 징검다리**가 될 것입니다. 

여러분의 손목 위에서 돌아가는 작은 시계가, 앞으로는 여러분의 생명을 지키는 든든한 파수꾼이 될 날이 머지않아 보입니다.


chatGPT

스마트워치가 내 건강을 예측할 수 있을까?

– 애플 연구진이 만든 ‘행동 데이터 AI’ 이야기

요즘 많은 사람들이 스마트워치나 스마트폰으로 걸음 수, 심박수, 수면 시간 등을 기록합니다. 그런데 이런 데이터가 단순한 “운동 기록”을 넘어서 실제 건강 상태까지 예측할 수 있다면 어떨까요? 최근 발표된 연구인 《Beyond Sensor Data: Foundation Models of Behavioral Data from Wearables Improve Health Predictions》는 바로 이 질문에 도전한 연구입니다. 이 논문은 애플(Apple) 연구진이 수행했으며, 웨어러블 기기에서 나오는 행동 데이터를 대규모 AI 모델로 학습시켜 건강 상태를 예측하는 방법을 제안했습니다.

기존의 웨어러블 AI 연구는 대부분 심박파(PPG), 심전도(ECG), 가속도 센서 같은 “원시 센서 데이터”를 분석하는 데 집중했습니다. 하지만 연구진은 오히려 사람이 실제로 어떻게 생활하는지를 보여주는 행동 데이터가 더 중요할 수 있다고 보았습니다. 예를 들어 단순한 심박수보다 “얼마나 걷는지”, “운동량이 줄었는지”, “수면 패턴이 달라졌는지” 같은 정보가 건강 상태를 더 잘 반영할 수 있다는 것입니다.

연구진은 Apple Heart and Movement Study라는 초대형 연구 데이터를 활용했습니다. 무려 약 16만 명 이상의 참가자가 제공한 데이터를 사용했고, 총 데이터 양은 25억 시간 이상이었습니다. 이는 지금까지 웨어러블 연구 중에서도 매우 큰 규모에 해당합니다. 연구에 사용된 정보는 걸음 수, 운동 시간, 심박수, 심박변이도, 혈중 산소포화도, 호흡수, 체온, 보행 안정성, 계단 오르는 속도, VO2Max 같은 심폐 지표 등 총 27개의 건강 관련 변수였습니다.

이 연구의 핵심은 “WBM(Wearable Behavior Model)”이라는 AI 모델입니다. 쉽게 말하면 사람의 일주일 생활 패턴을 하나의 건강 프로필처럼 이해하는 AI입니다. 연구진은 일주일 동안의 행동 데이터를 시간 단위로 정리해 AI가 학습하도록 만들었습니다. 예를 들어 월요일 새벽부터 일요일 밤까지의 생활 흐름 전체를 하나의 패턴으로 본 것입니다.

흥미로운 점은 이 데이터가 매우 불규칙하다는 사실입니다. 어떤 사람은 하루 종일 시계를 차고 있지만, 어떤 사람은 자주 벗어둡니다. 또 어떤 데이터는 하루에 한 번 측정되고, 어떤 것은 몇 분마다 기록됩니다. 이런 문제 때문에 일반적인 AI 모델은 잘 작동하지 않았습니다. 연구진은 여러 AI 구조를 비교한 끝에 “Mamba-2”라는 비교적 새로운 구조가 가장 성능이 좋다는 사실을 발견했습니다. 이는 기존에 유명했던 Transformer 방식보다 더 효율적으로 시간 흐름 데이터를 이해할 수 있었기 때문입니다.

그렇다면 실제 성능은 어땠을까요? 결과는 꽤 인상적이었습니다. 이 AI는 나이와 성별뿐 아니라 다양한 질환과 건강 상태를 예측했습니다. 예를 들어 당뇨병, 임신 여부, 감염 상태, 부상 여부, 수면 상태 등을 상당히 정확하게 구분했습니다. 특히 수면 관련 예측에서 강력한 성능을 보였습니다. 사람의 행동 데이터에는 밤 시간 움직임 감소, 심박 변화, 활동량 감소 등이 포함되기 때문에 실제 수면 상태를 잘 반영했던 것입니다.

또 흥미로운 결과는 행동 데이터와 원시 센서 데이터를 함께 사용했을 때였습니다. 행동 데이터만 사용하는 것보다, 심박 센서 데이터까지 함께 결합하면 대부분의 건강 예측 성능이 더 좋아졌습니다. 예를 들어 임신 예측에서는 두 데이터를 함께 사용했을 때 정확도가 매우 크게 향상되었습니다. 연구진은 이를 통해 “행동 데이터와 생체 센서 데이터는 서로 경쟁 관계가 아니라 서로 보완 관계”라고 설명했습니다.

특히 이 연구는 단순히 “질병이 있는 사람”을 찾는 수준을 넘어, 시간에 따라 변하는 건강 상태를 추적할 수 있다는 점이 중요합니다. 예를 들어 감염 초기에는 활동량이 줄고 수면 패턴이 달라질 수 있는데, AI가 이런 작은 변화를 감지해 건강 이상 신호를 발견할 가능성이 있다는 뜻입니다. 이는 미래 의료에서 조기 경고 시스템으로 활용될 가능성을 보여줍니다.

물론 한계도 있습니다. 연구 참가자 대부분은 아이폰과 애플워치 사용자였기 때문에 일반 인구 전체를 완벽하게 대표한다고 보기는 어렵습니다. 또한 일부 건강 정보는 참가자가 직접 설문으로 입력한 내용이라 정확하지 않을 가능성도 있습니다. 연구진 역시 이 AI가 아직 미래 질병을 완벽하게 예측하는 단계는 아니라고 설명했습니다.

그럼에도 이 연구가 중요한 이유는 매우 분명합니다. 지금까지의 의료는 병원에 가서 검사를 받아야 건강 상태를 알 수 있는 경우가 많았습니다. 하지만 이 연구는 우리가 평소 생활하면서 남기는 작은 행동 데이터만으로도 건강 변화를 감지할 수 있다는 가능성을 보여줍니다. 다시 말해 스마트워치가 단순한 운동 기록 장치를 넘어 “개인의 건강 변화를 조용히 관찰하는 조기 경고 시스템”이 될 수 있다는 의미입니다.

앞으로 이런 기술이 발전하면 병이 심해지기 전에 위험 신호를 발견하거나, 개인별 맞춤 건강 관리 서비스를 제공하는 시대가 올 수도 있습니다. 특히 병원 접근이 어려운 사람들에게는 매우 큰 도움이 될 가능성이 있습니다. 결국 이 연구는 “사람의 일상 행동 자체가 건강 정보가 될 수 있다”는 사실을 AI를 통해 과학적으로 보여준 중요한 연구라고 할 수 있습니다.


grok

**스마트워치가 알려주는 건강의 미래: 행동 데이터로 만드는 ‘기초 모델’ 이야기**

요즘 스마트워치나 피트니스 트래커를 차고 다니는 사람들이 많아졌습니다. 심박수, 걸음 수, 수면 시간 같은 데이터를 매일 기록하죠. 그런데 이 데이터들을 단순히 ‘오늘 걸음 수가 얼마’ 정도로만 보는 게 아니라, AI가 깊이 분석해 우리의 건강 상태를 미리 알려줄 수 있다면 어떨까요?

최근 애플 연구팀이 발표한 논문은 바로 그 가능성을 보여줍니다. 제목은 ‘Beyond Sensor Data: Foundation Models of Behavioral Data from Wearables Improve Health Predictions’로, 쉽게 말해 “센서 데이터 너머, 웨어러블 행동 데이터로 만든 기초 모델이 건강 예측을 더 잘한다”는 내용입니다.

### 연구 배경과 목적

지금까지 웨어러블 AI 연구는 주로 심박수 같은 ‘원시 센서 데이터(PPG 등)’에 집중했습니다. 하지만 실제 건강 예측(예: 수면의 질, 임신 여부, 감염 가능성, 만성질환 위험 등)에는 하루·주 단위의 ‘행동 패턴’이 더 중요합니다. 

예를 들어, 임신 중에는 활동량과 걸음걸이가 변하고, 다리를 다치면 이동 패턴이 달라지죠. 연구팀은 이런 ‘행동 데이터’—활동량, 심박수 변이, 이동 속도, VO2max(심폐지구력) 등 27가지 지표—에 주목했습니다. 

목적은 명확했습니다. **162,000명 이상의 실제 사용자 데이터(총 25억 시간 이상)**를 바탕으로, 불규칙하고 결측치가 많은 행동 데이터를 잘 이해하는 ‘기초 모델(WBM)’을 만들어 다양한 건강 예측에 활용하는 것입니다.

### 어떻게 만들었을까? (방법)

연구팀은 애플 하트 앤 무브먼트 스터디(AHMS)라는 대규모 관찰 연구 데이터를 사용했습니다. 참여자들은 애플워치와 아이폰으로 자연스럽게 생활하면서 데이터를 수집했어요.

- 데이터를 **시간당**으로 모아 **주 단위(168시간)**로 정리

- 결측치 처리, 변수별 임베딩 등 다양한 토크나이저(데이터 변환 방법) 실험

- 트랜스포머, 롤리, 맘바-2(Mamba-2) 등 여러 AI 아키텍처 비교

결국 가장 좋은 성능을 낸 조합은 **TST(밀집 행렬 방식) + Mamba-2** 모델이었습니다. 이 모델을 ‘대조 학습(contrastive learning)’으로 사전 학습시켜, 같은 사람의 다른 주 데이터를 비슷하게 인식하도록 만들었어요. 

학습 후에는 선형 분류기(간단한 머리 부분)만 붙여서 **57가지 건강 예측 과제**를 테스트했습니다. 나이·성별 예측부터 당뇨, 임신, 감염, 수면 질, 약물 복용 여부 등 정말 다양한 과제였습니다.

### 주요 결과

WBM은 단순 통계 기반 베이스라인을 크게 앞섰습니다. 특히 **수면 관련 예측**에서는 압도적으로 좋았어요. 행동 데이터는 하루 종일 활동을 보고 있으니 수면 시간을 더 정확히 추정할 수 있었던 거죠.

기존 PPG(광용적맥파) 센서 기초 모델과 비교했을 때:

- 행동 중심 과제(수면, 부상)에서는 WBM이 더 우수

- 생리 중심 과제에서는 PPG가 강함

- **두 모델을 합치면 대부분의 과제에서 최고 성능**

예를 들어 임신 예측에서는 두 모델을 합쳤을 때 AUROC 0.92 이상으로 매우 높은 정확도를 보였습니다. 행동 변화와 생리 변화를 모두 잡아낸 결과예요.

### 고찰과 의의

이 연구의 핵심 메시지는 “행동 데이터가 센서 데이터와 **보완적**”이라는 점입니다. 원시 센서는 순간순간의 생리를 잘 보지만, 행동 데이터는 사람의 생활 패턴과 건강 상태를 더 넓고 긴 시간 scale로 이해합니다.

특히 불규칙하고 결측치 많은 실생활 데이터를 다루는 데 최적화된 모델 설계 과정(토크나이저와 아키텍처 비교)이 인상적이었습니다. “데이터 종류에 따라 모델도 달라져야 한다”는 교훈을 줍니다.

### 왜 이 연구가 중요한가?

우리는 이제 웨어러블 기기를 단순한 ‘운동 트래커’가 아닌, **개인 맞춤형 건강 동반자**로 만들어가고 있습니다. 이 모델이 실생활에 적용되면:

- 조기 질환 발견

- 만성질환 관리

- 임신·수면·회복 등 일상 건강 모니터링

이 더 정확해질 수 있습니다. 무엇보다 대규모 실세계 데이터를 활용해 ‘일반인’의 건강을 예측한다는 점에서 의미가 큽니다.

물론 프라이버시, 공정성, 실제 임상 적용 등의 과제가 남아있지만, 이 연구는 “행동 데이터를 제대로 이해하면 건강 AI의 지평이 넓어진다”는 가능성을 명확히 보여주었습니다.

스마트워치를 차고 사는 우리 모두에게, 조용히 건강을 지켜주는 똑똑한 AI 동반자가 가까워지고 있다는 소식입니다. 앞으로가 정말 기대되네요.


NotebookLM

안녕하세요! 저는 웨어러블 기기와 인공지능을 활용한 건강 예측 분야에서 박사 학위를 받고 현장에서 오랫동안 데이터를 분석해 온 전문가입니다. 오늘은 우리가 매일 차고 다니는 스마트워치가 어떻게 단순한 '만보기'를 넘어 우리 건강의 미래를 예측하는 '똑똑한 건강 비서'가 될 수 있는지, 최근 발표된 흥미로운 연구(2507.00191v1)를 바탕으로 아주 쉽게 설명해 드릴게요.

**[블로그 포스팅] 스마트워치가 읽어내는 내 몸의 비밀: 인공지능이 '행동'을 공부하면 생기는 일**

스마트워치나 피트니스 트래커를 사용하시나요? 대부분 걸음 수나 심박수를 확인하는 용도로 쓰실 텐데요. 하지만 이 작은 기기 속에는 우리가 미처 몰랐던 엄청난 건강 정보가 숨어 있습니다. 지금까지의 인공지능은 주로 '심장 박동 한 번'과 같은 아주 세밀한 데이터에만 집중해 왔습니다. 하지만 이번 연구는 우리가 며칠, 몇 주 동안 어떻게 움직이고 잠을 자는지와 같은 '행동 데이터'에 집중했을 때 건강 예측이 훨씬 정확해진다는 사실을 밝혀냈습니다,,.

**1. 연구 배경: 왜 인공지능은 우리의 '행동'을 공부해야 할까요?**

기존의 인공지능 모델들은 주로 심박수 센서에서 나오는 가공되지 않은 '원시 데이터'를 분석하는 데 치중했습니다,. 하지만 이런 데이터는 하루 종일 일정하게 수집되지 않는 경우가 많고, 우리가 실제로 어떤 상태인지를 전체적으로 보여주기에는 한계가 있었습니다. 반면 우리가 얼마나 걷는지, 계단을 얼마나 오르는지, 보행 속도가 어떤지와 같은 '행동 데이터'는 우리 몸의 생리적 상태와 아주 밀접하게 연결되어 있습니다. 예를 들어, 임신 중이거나 다리를 다쳤을 때는 보행 속도나 움직임 패턴이 변하게 되는데, 이런 변화가 건강 상태를 감지하는 데 아주 중요한 단서가 되기 때문입니다.

**2. 연구 목적: 건강 예측을 위한 '만능 인공지능' 만들기**

이 연구의 목적은 엄청난 양의 웨어러블 데이터를 학습시켜, 어떤 건강 문제든 척척 예측할 수 있는 '기반 모델(Foundation Model)'을 만드는 것입니다,. 마치 우리가 챗GPT를 다양한 용도로 쓰는 것처럼, 건강 데이터계의 챗GPT를 만들어 질병의 역사, 약물 복용 여부, 현재의 건강 상태 변화 등을 한꺼번에 읽어낼 수 있는 인공지능 'WBM(Wearable Behavior Foundation Model)'을 개발하고자 했습니다,.

**3. 연구 방법: 16만 명의 5년치 기록을 학습하다**

연구팀은 '애플 하트 앤 무브먼트 연구(Apple Heart and Movement Study)'를 통해 모인 약 16만 명의 데이터를 활용했습니다,. 무려 25억 시간 이상의 데이터가 투입되었는데, 이는 지금까지 웨어러블 연구 중 가장 큰 규모입니다,. 인공지능은 걸음 수, 에너지 소비량, 보행 속도, 수면 단계 등 전문가들이 엄선한 27가지의 핵심 행동 지표를 학습했습니다,. 특히 데이터가 중간에 비어있거나 불규칙하게 수집되는 실제 상황에서도 잘 작동하도록 '맘바-2(Mamba-2)'라는 최신 인공지능 구조를 사용해 모델을 완성했습니다,,.

**4. 주요 연구 결과: 57가지 건강 과제를 풀어내다**

완성된 인공지능 'WBM'은 57가지의 다양한 건강 관련 과제에서 놀라운 실력을 보여주었습니다,. 단순히 나이나 성별을 맞히는 것을 넘어, 당뇨병 유무, 임신 여부, 호흡기 감염, 심지어 부상 상태까지 정확하게 감지해 냈습니다,,. 특히 수면 시간이나 수면 효율을 예측하는 데 있어서는 기존의 센서 기반 모델보다 훨씬 뛰어난 성능을 보였습니다. 연구팀은 또한 이 모델이 원시 심박수 데이터(PPG) 기반 모델과 결합했을 때, 서로의 부족한 점을 보완하며 가장 강력한 예측력을 발휘한다는 사실도 확인했습니다,.

**5. 고찰 및 시사점: 원시 데이터와 행동 데이터의 환상적인 팀워크**

이번 연구를 통해 얻은 가장 큰 깨달음은 '행동 데이터'와 '원시 센서 데이터'가 각각 장점이 다르다는 것입니다,. 심장 박동 데이터는 생리적인 변화를 예민하게 읽어내고, 행동 데이터는 우리가 실생활에서 어떻게 움직이는지를 통해 건강의 큰 흐름을 읽어냅니다. 이 두 가지 정보를 합치면 임신처럼 몸의 내부 상태와 행동이 동시에 변하는 상황을 90% 이상의 정확도로 맞힐 수 있습니다. 또한, 인공지능이 복잡한 정보를 스스로 학습하면서도 연구자가 중요하게 생각하는 핵심 지표들을 잘 보존하고 있다는 것도 확인되었습니다,.

**6. 의의와 시사점: 병원에 가기 전, 시계가 먼저 말을 거는 시대**

이 연구는 스마트워치만으로도 병원 기록만큼이나 정확하게 우리 건강의 변화를 추적할 수 있는 길을 열었다는 데 큰 의의가 있습니다. 이 기술이 발전하면 우리가 증상을 느끼기도 전에 스마트워치가 "최근 보행 패턴과 심박수가 감염 징후를 보입니다. 휴식이 필요해요"라고 먼저 알려줄 수 있습니다. 또한, 병원 접근성이 떨어지는 곳에 사는 사람들에게는 비침습적이고 저렴한 건강 모니터링 도구가 되어 의료 격차를 줄이는 데도 도움을 줄 수 있습니다,.

**💡 이 연구가 왜 중요한가요?**

이 연구가 중요한 이유는 **"우리의 평범한 일상이 가장 강력한 건강 데이터"**라는 것을 과학적으로 증명했기 때문입니다. 지금까지는 병원에서 검사한 결과만 믿었다면, 이제는 우리가 매일 걷고 자고 움직이는 그 자체가 건강의 예보가 될 수 있습니다,. 인공지능이 우리의 사소한 행동 변화를 읽어내어 질병을 미리 예측할 수 있다면, 치료 중심의 의료가 '예방 중심'으로 바뀌는 거대한 변화를 맞이하게 될 것입니다. 결국 이 기술은 우리 모두가 더 오래, 더 건강하게 살 수 있도록 돕는 가장 든든한 과학적 나침반이 될 것입니다.


Perplexity.ai

이 논문은 **웨어러블 기기에서 나오는 “행동 정보”만으로도 건강 상태를 꽤 잘 예측할 수 있다**는 점을 보여준 연구입니다. 쉽게 말해, 심박수 같은 원시 센서값만 보는 것이 아니라, 걸음 수·운동 시간·서 있는 시간·수면 관련 지표처럼 생활 패턴을 반영하는 데이터를 모아 건강을 읽어내는 새 모델을 만들었습니다. 

## 연구 배경

최근 스마트워치와 같은 웨어러블 기기는 심박수, 걸음 수, 수면, 움직임 같은 정보를 아주 많이 모읍니다. 그런데 기존 연구는 주로 심전도, 맥파, 가속도계처럼 “아주 낮은 수준의 센서 신호”에 집중했고, 생활습관과 더 가까운 “행동 데이터”를 크게 활용하지는 못했습니다. 이 논문은 바로 그 빈틈에 주목했고, 건강을 더 넓은 관점에서 보기 위해 행동 데이터를 학습하는 기반모델을 만들었습니다. 

## 연구 목적

이 연구의 핵심 목적은 웨어러블에서 얻는 행동 데이터를 이용해 **다양한 건강 문제를 한 번에 잘 예측하는 공통 모델**을 만드는 것입니다. 연구진은 특히 데이터가 들쭉날쭉하고 빠진 값도 많은 현실의 웨어러블 정보에서, 여러 질병이나 상태를 두루 예측할 수 있는지 확인하고자 했습니다. 또한 행동 데이터가 기존의 PPG 같은 생체신호 모델과 함께 쓰일 때 더 좋아지는지도 살펴봤습니다. 

## 연구 방법

연구진은 Apple Heart and Movement Study의 매우 큰 규모의 웨어러블 데이터를 사용했습니다. 총 16만 명이 넘는 참가자와 1,500만 주가 넘는 주간 데이터, 25억 시간 이상의 측정값을 바탕으로 모델을 학습했습니다. 

이 데이터에는 활동량, 심박수, 호흡수, 혈중산소, 체온, 걸음의 안정성, VO2 max 같은 27가지 건강 관련 지표가 들어 있습니다. 연구진은 이 불규칙한 시계열 데이터를 한 주 단위로 묶어 모델에 넣었고, 여러 토큰화 방식과 여러 구조를 비교한 뒤 가장 잘 맞는 조합을 찾았습니다. 그 결과 **TST 방식의 입력 표현과 Mamba-2 구조**가 가장 좋은 성능을 보여 최종 모델이 되었습니다. 

## 연구 결과

이 모델은 나이와 성별 같은 기본 정보부터 당뇨, 임신, 감염, 부상, 수면 관련 지표, 각종 질환과 약물 복용 여부까지 폭넓은 과제에서 좋은 성능을 보였습니다. 특히 단순한 기준모델보다 훨씬 나았고, 행동 모델만으로도 많은 경우 유의미한 건강 정보를 담고 있다는 점이 확인되었습니다. 

흥미로운 점은 행동 데이터와 PPG 모델을 **함께** 쓰면 성능이 더 좋아지는 경우가 많았다는 것입니다. 예를 들어 임신, 수면, 감염, 부상처럼 생활 패턴 변화가 중요한 문제에서 두 모델을 합친 조합이 가장 강한 결과를 냈습니다. 반면 당뇨처럼 원시 생리신호만으로도 충분한 문제에서는 PPG가 더 강한 경우도 있었습니다. 

## 해석과 고찰

이 연구가 보여주는 중요한 메시지는 “건강은 몸속 신호만으로 설명되지 않고, 생활 습관과 행동에도 많이 드러난다”는 점입니다. 예를 들어 누군가가 아프거나 다치면 걸음 수, 이동 패턴, 활동량, 수면 패턴이 함께 변할 수 있는데, 이런 변화는 행동 데이터에서 잘 잡힙니다. 반대로 혈압약 복용이나 당뇨 같은 일부 문제는 생리신호 자체가 더 직접적인 단서가 되기도 해서, 두 정보는 서로 보완적입니다. 

또 하나의 의미는, 복잡한 모델이 항상 최고는 아니었다는 점입니다. 연구진은 여러 방법을 비교했는데, 오히려 비교적 단순한 입력 방식이 더 잘 맞는 경우도 있었고, Transformer보다 Mamba-2가 더 좋게 나온 점도 인상적이었습니다. 이는 웨어러블 데이터처럼 빠진 값이 많고 불규칙한 데이터에서는, 데이터 특성에 맞는 설계가 정말 중요하다는 뜻입니다. 

## 의의와 시사점

이 논문은 웨어러블 데이터를 단순한 운동 기록이 아니라 **건강 예측의 중요한 단서**로 확장했다는 점에서 의미가 큽니다. 앞으로 이런 모델이 잘 발전하면, 병원이 아니어도 일상 속에서 건강 이상 신호를 더 일찍 발견하고, 개인 맞춤형 건강관리나 조기 개입에 도움을 줄 수 있습니다. 

다만 저자들도 지적했듯이, 이 연구는 Apple 기기 사용자와 자발적 참여자 중심 데이터라는 한계가 있어 모든 사람에게 똑같이 적용되지는 않을 수 있습니다. 그럼에도 불구하고 “행동 데이터만으로도 건강을 꽤 잘 읽을 수 있다”는 사실을 대규모로 보여줬다는 점에서, 디지털 헬스와 예방의학에 큰 출발점이 되는 연구라고 볼 수 있습니다. 

이 연구가 중요한 이유는, **아픈 뒤에 치료하는 방식에서 벗어나 일상 데이터로 건강 변화를 더 빨리 알아차릴 가능성**을 열어주기 때문입니다. 


Kimi

이 논문의 내용을 중학생도 이해할 수 있는 수준으로 블로그용 글로 작성하겠습니다. 논문의 핵심 내용을 정리하고, 쉬운 비유와 설명을 곁들여서 A4 두 장 분량으로 구성하겠습니다.

---

**스마트워치가 우리 건강을 어떻게 읽어낼까? - 행동 데이터로 만든 AI 건강 예측 모델**

우리는 매일 스마트워치를 차고 산다. 걸음 수를 세고, 심박수를 체크하고, 수면 시간을 기록한다. 하지만 이 방대한 데이터를 단순히 '기록'하는 데 그칠까? 아니다. 이 데이터를 통해 우리의 건강 상태를 예측할 수 있다면 어떨까? 애플의 연구팀이 바로 이 질문에 답하고자 한 연구를 발표했다. 그들은 스마트워치에서 수집된 '행동 데이터'를 바탕으로 한 AI 기반 건강 예측 모델을 개발했다.

**연구 배경: 왜 행동 데이터인가?**

지금까지 웨어러블 기기의 AI 연구는 대부분 '원시 센서 데이터'에 집중했다. 예를 들어 피부에 비친 빛으로 맥박을 측정하는 PPG(광용적맥파) 신호나, 가속도계의 미세한 진동 데이터 같은 것이다. 이런 데이터는 매우 세밀하지만 문제가 있다. 하루에 몇 번만 측정되고, 측정 조건에 민감하며, 배터리 소모도 크다. 반면 '행동 데이터'는 다르다. 걸음 수, 활동 칼로리, 서 있는 시간, 이동 속도, 수면 패턴 등은 이미 검증된 알고리즘으로 가공된 지표다. 이 데이터들은 생리학적으로 의미 있는 시간 단위(시간, 일, 주)로 집계되어 있어 건강 상태와 더 직접적으로 연결된다. 예를 들어 누군가의 '걸음 속도가 느려졌다'는 것은 단순한 활동 변화가 아니라, 무릎 관절염이나 심부전 같은 질환의 신호일 수 있다. 연구팀은 이런 행동 데이터가 건강 예측에 더 풍부한 정보를 담고 있을 것이라고 가정했다.

**연구 목적: 행동 데이터로 만든 '건강 예측의 기초 모델'**

이 연구의 목표는 명확했다. 첫째, 스마트워치 행동 데이터만으로 다양한 건강 상태를 예측할 수 있는 '기초 모델(Foundation Model)'을 만드는 것이다. 기초 모델이란 방대한 데이터로 사전 학습된 후, 적은 양의 추가 데이터로도 다양한 과제를 해결할 수 있는 AI를 의미한다. 둘째, 행동 데이터가 기존의 원시 센서 데이터(PPG)와 어떻게 상호 보완적인지 밝히는 것이다. 셋째, 실제 임상 현장에서 쓸 수 있을 만큼 다양하고 현실적인 건강 과제에서 이 모델의 성능을 검증하는 것이다.

**연구 방법: 16만 명의 25억 시간 데이터로 AI 훈련시키기**

연구팀은 '애플 하트 앤 무브먼트 스터디(AHMS)'라는 대규모 연구의 데이터를 사용했다. 이는 미국 심장협회와 브리검 여성병원과 협력해 진행된 연구로, 27만 명 이상이 참여하고 최대 5년간 추적 관찰한 세계 최대 규모의 웨어러블 데이터베이스다. 연구팀은 이 중 16만 1,855명의 참가자로부터 수집된 총 15억 건의 시간당 건강 데이터(약 25억 시간 분량)를 사용했다.

모델에 입력된 데이터는 총 27가지 건강 행동 지표였다. 활동량(걸음 수, 운동 시간, 계단 오르기 등), 심혈관(안정 시 심박수, 보행 시 심박수 등), 활력징후(호흡수, 혈중산소포화도, 손목 온도), 보행/이동성(보행 속도, 보폭, 보행 안정성, 낙상 횟수 등), 신체 측정(체중, BMI), 심폐 기능(최대 산소 섭취량, 6분 보행 거리) 등이다. 이 데이터의 특징은 '불규칙성'이다. 어떤 지표는 매시간 측정되지만(심박수), 어떤 지표는 일주일에 한 번(보행 안정성), 어떤 지표는 한 달에 한 번(최대 산소 섭취량) 측정된다. 또한 참가자마다 데이터가 누락되는 패턴도 제각각이다.

이런 불규칙한 데이터를 다루기 위해 연구팀은 세 가지 '토큰화' 방식과 세 가지 AI 아키텍처를 조합해 총 9가지 모델을 실험했다. 토큰화란 AI가 이해할 수 있는 형태로 데이터를 변환하는 과정이다. 'TST' 방식은 누락된 값을 전체 평균으로 채워 정사각 행렬을 만드는 단순한 방법, 'mTAN'은 누락을 마스킹하여 처리하는 방법, 'Tuple'은 각 측정값을 시간-변수-값의 세 쌍으로 표현하는 방법이다. 아키텍처는 전통적인 '트랜스포머', 상대적 위치 정보를 활용하는 '로터리 트랜스포머', 그리고 최근 주목받는 'Mamba-2' 상태 공간 모델을 사용했다.

놀랍게도 가장 복잡한 방법이 아니라, 가장 단순한 'TST 토큰화 + Mamba-2 아키텍처' 조합이 가장 좋은 성능을 보였다. 연구팀은 이를 'WBM(Wearable health Behavior Model)'이라 명명했다. WBM은 한 주(168시간)의 데이터를 입력받아 한 사람의 건강 상태를 압축한 '임베딩 벡터'를 출력한다. 학습은 '대조 학습(Contrastive Learning)' 방식으로 진행됐는데, 같은 사람의 두 주간 데이터를 '긍정 쌍'으로, 다른 사람의 데이터를 '부정 쌍'으로 삼아 AI가 같은 사람의 데이터는 가깝게, 다른 사람의 데이터는 멀게 배치하도록 훈련시킨 것이다.

**연구 결과: 57가지 건강 과제에서 검증된 놀라운 성능**

WBM의 성능은 총 57가지 건강 예측 과제에서 검증됐다. 이 과제들은 두 종류로 나뉜다. '개인 간 과제'는 각자의 고정된 건강 상태(성별, 연령, 과거 병력, 복용 약물 등)를 예측하는 것이고, '개인 내 과제'는 시간에 따라 변하는 건강 상태(수면의 질, 임신 여부, 호흡기 감염, 부상 등)를 예측하는 것이다.

먼저 연령 예측에서 WBM은 평균 절대 오차 3.67세를 기록했다. 단순 통계 기반 모델(7.89세 오차)보다 훨씬 정확했고, PPG 모델(2.89세)보다는 다소 떨어졌으나 두 모델을 결합하면 2.46세로 더욱 정밀해졌다. 성별 예측에서는 WBM 단독으로 AUROC 0.999라는 거의 완벽에 가까운 성능을 보였다.

47가지 기저 질환 및 약물 복용 예측에서 WBM은 39개 과제에서 단순 기준 모델을 능가했고, 중앙값 AUROC 향상 폭은 0.017이었다. 특히 수면 관련 과제에서 WBM은 압도적이었다. 수면 시간 예측에서 단순 모델의 R²가 0.104에 불과했던 반면, WBM은 0.590을 기록했다. 이는 PPG 모델(0.110)보다도 월등히 높은 수치다. 왜 그럴까? 수면은 밤새 움직임이 없는 시간, 즉 행동의 '부재'로 측정되는데, 행동 데이터는 24시간 내내 기록되지만 PPG는 하루에 몇 번만 측정되기 때문이다. 임신 예측에서도 WBM은 AUROC 0.864, PPG는 0.873으로 비슷했지만, 두 모델을 결합하면 0.921로 크게 향상됐다. 임신은 생리적 변화(PPG가 잘 잡아냄)와 행동적 변화(운동량 감소, 수면 패턴 변화 등 WBM이 잘 잡아냄)가 동시에 일어나는 대표적인 예시다.

반면 당뇨병 예측에서는 PPG 모델(AUROC 0.829)이 WBM(0.765)보다 월등히 우수했다. 이는 당뇨병이 혈당이라는 생리적 지표의 변화로 직접 감지될 수 있어, 원시 생체신호가 더 유리한 경우다. 항우울제 복용 예측에서도 PPG가 더 높은 성능을 보였는데, 이는 과거 연구에서도 밝혀진 바 있다.

가장 중요한 발견은 'WBM + PPG 결합 모델'이 47개 과제 중 42개에서 최고 성능을 보였다는 점이다. 중앙값 AUROC 행상 폭은 0.009로 보수적이나, 통계적으로 유의미한 개선이 38개(WBM 대비) 및 33개(PPG 대비) 과제에서 나타났다. 특히 심방세동(Afib) 예측에서는 PPG 대비 0.034, 베타 차단제 복용 예측에서는 0.055, 칼슘 채널 차단제 복용 예측에서는 0.033의 AUROC 향상을 보였다. 이는 행동 데이터와 원시 센서 데이터가 서로 다른 관점에서 건강을 바라보기 때문에 결합했을 때 시너지가 발생함을 보여준다.

**고찰: 왜 단순한 방법이 최고였을까?**

연구팀은 몇 가지 흥미로운 점을 지적했다. 첫째, 불규칙한 데이터를 다루는 가장 정교한 방법(mTAN, Tuple)보다 단순 평균 대치(TST)가 더 나은 이유는, 웨어러블 데이터의 노이즈가 워낙 커서 개인별 평균을 추정하는 것 자체가 불안정했기 때문이다. 둘째, 트랜스포머 대신 Mamba-2가 더 나은 이유는, 상태 공간 모델이 불규칙한 시간 간격을 자연스럽게 처리하는 특성 때문으로 추정된다. 셋째, 가면 자동 인코더(MAE) 같은 다른 사전 학습 방법은 성능이 매우 낮았는데(연령 예측 MAE 6.39세), 이는 희소하지만 중요한 변수(예: 최대 산소 섭취량)를 복원하는 데 실패하기 때문이다. 대조 학습은 모든 변수를 균형 있게 학습하는 데 더 적합했다.

또한 WBM 임베딩이 실제로 어떤 정보를 담고 있는지 살펴보기 위해, 임베딩으로부터 27개 입력 변수의 주간 평균을 재구성하는 실험을 했다. 결과적으로 안정 시 심박수(R² 0.942), 심박수(0.938), 최대 산소 섭취량(0.929) 등은 거의 완벽하게 복원됐으나, 활동 칼로리(0.011)와 BMI(0.000)는 거의 복원되지 않았다. 이는 대조 학습이 심박수와 높은 상관관계를 가지는 활동 칼로리를 '중복 정보'로 간주하고 버렸기 때문으로 분석된다. 이는 모델이 효율적으로 정보를 압축하고 있음을 보여주는 동시에, 어떤 변수가 실제로 예측에 기여하는지 해석하는 데 주의가 필요함을 시사한다.

인구통계학적 하위그룹 분석에서는 대부분의 모델이 다양한 인종, 연령, 성별에서 비슷한 성능을 보였으나, 일부 예외도 있었다. 특히 임신 예측에서 흑인 참가자의 경우 기준 모델이 WBM보다 더 나은 성능을 보이는 등, 데이터 편향이나 표본 크기의 문제가 있을 수 있음을 인지해야 한다.

**의의와 시사점: 건강의 미래를 바꿀 수 있을까?**

이 연구의 학문적 의의는 명확하다. 기존 웨어러블 AI 연구가 원시 센서 데이터에 치중했던 것과 달리, '행동 데이터'라는 새로운 패러다임을 제시하고 그 유효성을 대규모로 입증했다는 점이다. 또한 단순하지만 데이터 특성에 맞는 모델링(TST + Mamba-2)이 복잡한 방법보다 낫다는 것을 보여주어, 향후 웨어러블 데이터 모델링의 방향성을 제시했다.

실무적 시사점은 더 크다. 첫째, 행동 데이터는 계산 효율성이 높다. PPG와 같은 원시 신호를 실시간으로 처리하는 것은 배터리와 연산량 측면에서 부담스럽지만, 이미 가공된 행동 지표는 상대적으로 가볍다. 둘째, 행동 데이터는 '항상 켜져 있다'. PPG는 배터리 절약을 위해 간헐적으로 측정되지만, 걸음 수나 활동량은 지속적으로 추적된다. 셋째, 가장 중요한 점은 두 데이터의 결합이 거의 모든 과제에서 최고라는 사실이다. 이는 미래의 건강 모니터링 시스템이 '생체신호 + 행동 패턴'을 통합적으로 분석해야 함을 강력히 시사한다.

**이 연구가 왜 중요한가?**

이 연구는 단순히 '더 좋은 AI 모델을 만들었다'는 것을 넘어선다. 우리가 매일 착용하는 스마트워치가 '건강의 조기 경보 시스템'이 될 수 있다는 가능성을 열어준다. 예를 들어 누군가의 보행 속도가 점점 느려지고, 서 있는 시간이 줄고, 수면 효율이 떨어진다면, 이는 단순한 노화가 아니라 심부전이나 관절염, 우울증의 초기 신호일 수 있다. 이런 변화를 AI가 감지하고 의료진이나 본인에게 알려준다면, 병원에 가기 전에 미리 대처할 수 있다. 특히 의료 접근성이 낮은 지역이나 바쁜 일상으로 건강검진을 미루는 사람들에게 이런 기술은 생명을 구할 수도 있다.

물론 한계도 있다. 이 연구는 애플 워치 사용자 데이터로만 훈련됐기 때문에 다른 기기로 일반화될지는 미지수다. 또한 참가자가 자발적으로 연구에 참여한 디지털 건강 연구의 특성상, 저소득층이나 디지털 기기에 익숙하지 않은 고령층이 덜 포함되어 있을 수 있다. 따라서 이런 모델을 실제 임상에 적용할 때는 공정성, 해석 가능성, 다양한 인구 집단에서의 검증이 필수적이다.

그럼에도 불구하고 이 연구는 분명한 메시지를 던진다. 우리가 매일 만들어내는 '행동의 흔적'은 건강에 대한 풍부한 이야기를 담고 있으며, AI는 이제 그 이야기를 읽기 시작했다. 스마트워치가 단순한 ' fitness 기기'를 넘어 '건강의 수호자'로 거듭나는 그날이, 이 연구를 통해 한 걸음 더 다가왔다.





출처: @ye._.vely618