일요일, 2월 11, 2024

WGS 데이터를 활용하여 어떤 방법이 환자에게 보다 효과적인지 확인해보자

바다 건너 영국에서 진행하고 있는 WGS를 활용한 암환자들에 대한 치료 기회에 대한 내용에 대한 논문을 한번 bar..아니 gemini에게 물어봤습니다.

논문 제목은 "Insights for precision oncology from the integration of genomic and clinical data of 13,880 tumors from the 100,000 Genomes Cancer Programme"

doi: 10.1038/s41591-023-02682-0

입니다.


이번 프롬프트는 간결하게 "https://www.nature.com/articles/s41591-023-02682-0 이 연구를 하게 된 이유와 연구에 사용된 분석 방법, 그리고 결과에 대한 내용에 대해서 블로그에 게시할 수 있도록 정리해서 작성해줘" 라고 넣어봤습니다.


제목: 암 치료를 위한 개인화된 접근 방식

요약:

암은 전 세계적으로 사망 원인 1위입니다. 암 치료는 종종 화학 요법, 방사선 요법 및 수술을 포함하는 복잡한 과정입니다. 그러나 이러한 치료법은 모든 환자에게 효과적이지 않으며 종종 부작용을 유발할 수 있습니다.

연구 배경:

최근 몇 년 동안 암 치료에 대한 개인화된 접근 방식에 대한 관심이 높아졌습니다. 개인화된 치료는 환자의 특정 유전적 특성에 맞게 조정된 치료법입니다.

연구 방법:

이 연구는 100,000 게놈 프로젝트의 암 프로그램의 데이터를 사용했습니다. 이 프로젝트는 암 환자의 전체 게놈을 시퀀싱하는 것을 목표로 합니다. 연구원들은 33가지 암 유형의 13,880개 종양을 분석했습니다. 그들은 이 데이터를 실제 치료 및 결과 데이터와 연결했습니다.

연구 결과:

연구 결과는 WGS가 많은 암 유형에서 유용한 도구가 될 수 있음을 보여줍니다. WGS는 환자의 치료 반응에 영향을 미칠 수 있는 유전적 변화를 식별하는 데 사용할 수 있습니다. 이 정보는 더 개인화된 암 치료법을 개발하는 데 사용될 수 있습니다.

연구 결론:

이 연구는 WGS가 암 치료를 위한 개인화된 접근 방식을 개발하는 데 중요한 도구가 될 수 있음을 보여줍니다. WGS는 환자의 치료 반응을 예측하고 더 효과적이고 안전한 치료법을 개발하는 데 도움이 될 수 있습니다.

이 연구가 암 치료에 미치는 잠재적 영향:
- WGS는 암 치료의 성공률을 높이고 부작용을 줄이는 데 도움이 될 수 있습니다.
- WGS는 암 환자에게 더 나은 치료 옵션을 제공할 수 있습니다.
- WGS는 암 치료의 비용을 절감하는 데 도움이 될 수 있습니다.

이 연구의 한계:
이 연구는 100,000 게놈 프로젝트의 데이터를 사용했습니다. 이 데이터는 영국과 미국의 환자를 대상으로 합니다. 다른 국가의 환자에게도 WGS가 유용한 도구가 될지는 확실하지 않습니다.
이 연구는 WGS가 암 치료에 미치는 잠재적 영향을 평가했습니다. 그러나 WGS가 실제로 암 치료의 성공률을 높이고 부작용을 줄이는 데 도움이 되는지 여부는 더 많은 연구가 필요합니다.

 

개별 암종별 변이 종류에 따른 설명이 많이 생략되어 있긴하지만, 프롬프트를 잘 작성하면 필요에 맞는 내용을 잘 요약해서 정리해 줄 것으로 생각되고, 결국 깨작깨작 패널대신 걍 WGS를 하고 더불어 methylation, proteomics, RNAseq 등의 정보들도 조합하면 우리가 꿈꾸는 예후 예측이나 더 나은 환자의 치료를 제공할 수 있지 않겠냐고 잘 마무리하고 있는 논문 되겠습니다.

그리고 물론 위에 것을 하려면 아직 돈은 많이 든다. 언젠가 그렇듯이 이 또한 해결 할 수 있는 그 날이 오면 좋겠다. 라고 합니다. 


그럼 설 연휴 잘 마무리하는 걸로 :)




출처: @ye._.vely618


금요일, 1월 19, 2024

그렇다면 일루미나는 문제가 없을까?

이전 포스팅에서는 Ion torrent 데이터에 대해서 알아보았으니 이번에는 일루미나 데이터는 과연 괜찮은지 한번 알아보도록 하겠습니다.
그건 그렇고 이전 포스팅하고 꽤 오랜만에 하네요;;

Insight into biases and sequencing errors for amplicon sequencing with the Illumina MiSeq platform의 제목으로 amplicon 패널을 사용하여 일루미나 시퀀서의 편향과 에러에 대해서 한번 확인해봤다고 합니다.

DOI: https://doi.org/10.1093/nar/gku1341

이번에도 AI(Bing의 copilot입니다.)의 도움을 한번 받아보았습니다!!!


프롬프트
The following URL is a paper confirming the biases and errors of the Illumina MiSeq sequencer using the Amplicon panel, and the title is "Insight into biases and sequencing errors for amplicon sequencing with the Illumina MiSeq platform."

https://doi.org/10.1093/nar/gku1341

I am planning to organize and post the contents of this paper on my blog. Please summarize the problems that may arise when using the Amplicon method using Illumina MiSeq. It is said that the data used in the paper was 16S rRNA data. If there was an error, please explain how you corrected the error and what method you used. Also, if there is an error in the data, please explain how to efficiently handle it. Please write the draft to be posted on the blog in Korean.



안녕하세요. 오늘은 일루미나 MiSeq 시퀀서를 사용하여 앰플리콘 패널을 이용한 시퀀싱에 대한 편향과 오류를 확인하는 논문을 소개하고자 합니다. 논문의 제목은 "Insight into biases and sequencing errors for amplicon sequencing with the Illumina MiSeq platform"이고, 다음 URL에서 확인하실 수 있습니다.

https://doi.org/10.1093/nar/gku1341

이 논문에서는 16S rRNA 데이터를 사용하여 앰플리콘 방법을 이용한 시퀀싱의 문제점을 분석하였습니다. 앰플리콘 방법은 특정 DNA 영역을 증폭하여 시퀀싱하는 방법으로, 다양한 생물학적 응용에 사용됩니다. 그러나 이 방법에는 여러 가지 편향과 오류가 발생할 수 있습니다. 예를 들어, 증폭 과정에서 PCR 편향이나 증폭 돌연변이가 발생할 수 있고, 시퀀싱 과정에서는 인덱스 점프나 인덱스 오염, 품질 저하 등의 문제가 있을 수 있습니다.

이러한 편향과 오류는 시퀀싱 결과의 정확도와 신뢰도에 영향을 미칠 수 있으므로, 적절한 보정과 검증이 필요합니다. 이 논문에서는 일루미나 MiSeq 플랫폼을 사용하여 앰플리콘 시퀀싱을 수행한 데이터를 분석하고, 편향과 오류의 원인과 영향을 평가하였습니다. 또한, 편향과 오류를 줄이기 위한 몇 가지 방법을 제안하였습니다.

논문에서 사용한 데이터는 16S rRNA 데이터로, 박테리아의 다양성과 상대적 농도를 파악하기 위해 널리 사용되는 마커 유전자입니다. 16S rRNA 데이터는 앰플리콘 방법으로 쉽게 증폭할 수 있지만, 동시에 여러 가지 편향과 오류에 노출될 수 있습니다. 예를 들어, 16S rRNA 유전자는 다른 박테리아 간에 유사도가 높기 때문에, 인덱스 점프나 인덱스 오염이 발생하면 잘못된 분류가 될 수 있습니다. 또한, 16S rRNA 유전자는 GC 함량이 다양하기 때문에, PCR 편향이나 증폭 돌연변이가 발생하면 잘못된 상대적 농도가 산출될 수 있습니다.

논문에서는 이러한 편향과 오류를 검출하고 보정하기 위해 여러 가지 방법을 사용하였습니다. 예를 들어, 인덱스 점프나 인덱스 오염을 줄이기 위해, 인덱스 디자인을 최적화하고, 인덱스 프라이머를 제거하는 단계를 추가하였습니다. 또한, PCR 편향이나 증폭 돌연변이를 줄이기 위해, PCR 사이클 수를 최소화하고, 증폭 조건을 표준화하였습니다. 그리고, 시퀀싱 품질을 향상시키기 위해, 품질 저하가 발생하는 시퀀싱 끝부분을 잘라내고, 품질 점수를 기준으로 필터링하였습니다.

이렇게 보정된 데이터를 사용하여, 박테리아의 다양성과 상대적 농도를 분석하였습니다. 그 결과, 보정 전과 후의 데이터에서는 박테리아의 종류와 비율에 차이가 있음을 확인하였습니다. 이는 앰플리콘 시퀀싱에 발생하는 편향과 오류가 데이터 해석에 영향을 미칠 수 있음을 보여줍니다. 따라서, 앰플리콘 시퀀싱을 수행할 때는 편향과 오류를 최소화하고, 보정하고, 검증하는 과정이 필수적임을 강조하고자 합니다.

이 논문에서는 편향과 오류를 줄이기 위한 방법 외에도, 발생한 편향과 오류를 해결하기 위한 방법도 제시하였습니다. 예를 들어, 인덱스 점프나 인덱스 오염이 발생한 경우에는, 인덱스 정보를 이용하여 잘못된 분류를 수정하는 방법이 있습니다. 또한, PCR 편향이나 증폭 돌연변이가 발생한 경우에는, GC 보정이나 돌연변이 보정을 수행하는 방법이 있습니다. 이러한 방법들은 데이터의 정확도와 신뢰도를 더욱 높일 수 있습니다.

이상으로, 일루미나 MiSeq 시퀀서를 사용하여 앰플리콘 패널을 이용한 시퀀싱에 대한 편향과 오류를 확인하는 논문에 대해 소개하였습니다. 앰플리콘 시퀀싱은 매우 유용한 방법이지만, 동시에 주의가 필요한 방법이기도 합니다. 앰플리콘 시퀀싱을 수행하시는 분들께서는 이 논문을 참고하여, 데이터의 정확도와 신뢰도를 높이시기 바랍니다. 감사합니다.


라고 합니다.

좀 같은 말 늘려서 빙빙 돌려막는 느낌이 좀 들긴하지만....
그래도 짧지 않은 글을 작성해주니깐 좋은것 같습니다. :)








일요일, 12월 17, 2023

Ion Torrent 데이터는 어떻게 사용해야 할까?

S5 데이터를 생각보다 많이 만지고 있어서 간만에 S5의 데이터에서 주의해야하는 것들에 대한 논문한번 뒤적거려보았습니다.


2013년도에 나온 "Shining a Light on Dark Sequencing: Characterising Errors in Ion Torrent PGM Data" 으로 Ion Torrent의 PGM에서 발생 할 수 있는 문제들을 훑어본 논문으로 생각되어 읽어보았습니다.

DOI: 10.1371/journal.pcbi.1003031


음... 귀찮으니 일단 Copilot (with Bing Chat)에게 논문을 읽고 블로그용 컨텐트를 작성하는데 어떤 것들을 주의해야하는지에 대해서 작성해 달라고 하였습니다.


PGM이라는 시퀀싱 기계는 Ion Torrent의 제품으로, DNA를 분석하기 위해 반도체 칩을 사용하는 방식입니다. 이 방식은 다른 시퀀싱 기술에 비해 빠르고 저렴하게 데이터를 생성할 수 있는 장점이 있습니다. 하지만, PGM에서 발생할 수 있는 error에 대해서 주의해야 합니다.

PGM에서 생성되는 데이터는 다음과 같은 error를 포함할 수 있습니다.

- **Homopolymer error**: 연속된 동일한 염기가 있는 경우, 정확한 염기 수를 측정하기 어려운 error입니다. 예를 들어, AAAAA라는 염기가 있으면, PGM은 이것을 AAAA나 AAAAAA로 인식할 수 있습니다. 이러한 error는 PGM의 시그널 강도가 염기 수와 선형적으로 증가하지 않기 때문에 발생합니다.

- **GC bias**: GC 함량이 높거나 낮은 영역에서 시퀀싱 효율이 떨어지는 현상입니다. PGM은 GC 함량이 40% 이상인 영역에서 시퀀싱 효율이 감소하고, GC 함량이 60% 이상인 영역에서는 거의 시퀀싱되지 않습니다. 이러한 bias는 PGM의 PCR 과정에서 발생합니다.

- **Over- and under-sampling**: PGM에서는 반도체 칩에 DNA 분자를 고르게 분배하기 어렵습니다. 따라서 일부 영역은 다른 영역보다 많이 또는 적게 시퀀싱될 수 있습니다. 이러한 sampling bias는 PGM의 emulsion PCR 과정에서 발생합니다.


PGM 기계에서 생성되는 데이터를 사용할 때 주의해야 하는 것은 다음과 같습니다.

- **Error rate 확인**: PGM 데이터는 homopolymer error로 인해 다른 시퀀싱 데이터보다 error rate가 높을 수 있습니다. 따라서 PGM 데이터를 사용할 때에는 error rate를 확인하고, 필요한 경우 error correction을 수행해야 합니다.

- **GC bias 보정**: PGM 데이터는 GC bias로 인해 특정 영역의 시퀀싱 깊이가 왜곡될 수 있습니다. 따라서 PGM 데이터를 사용할 때에는 GC bias를 보정하거나, GC bias에 민감하지 않은 분석 방법을 사용해야 합니다.

- **Sampling depth 고려**: PGM 데이터는 over- and under-sampling으로 인해 일부 영역의 시퀀싱 깊이가 다른 영역보다 많이 또는 적게 될 수 있습니다. 따라서 PGM 데이터를 사용할 때에는 sampling depth를 고려하고, 필요한 경우 rarefaction을 수행해야 합니다.

PGM 기계는 혁신적인 시퀀싱 기술이지만, 그만큼 error와 bias에 주의해야 합니다. 이러한 문제점을 인식하고, 적절한 보정과 분석 방법을 사용한다면, PGM 데이터로부터 유용한 정보를 얻을 수 있을 것입니다.


제법... 괜찮습니다. 

Homopolymer 에러를 비롯해서 GC bias 에 대한 얘기도 해주고, 고르게 시퀀싱이 되지 않으니 read sampling에 대한 얘기도 함께 얘기해주었습니다. 제가 읽었으면 아마 Error rate 내용만 편향적으로 보고 "저거봐라 왜 Ion 쓰냐"라고 말을 줄이지 않았을까 합니다.

물론... 비정상적으로 긴 homopolymer 변이가 있는 종에 대해서는 도전정신을 가지고 Ion 시퀀서를 써봤자 너님만 손해다가 오늘의 한줄 요약 되겠습니다.



출처: ye._.vely618


월요일, 12월 11, 2023

Application of Next Generation Sequencing in Laboratory Medicine

임상검사실? 진단검사의학?에서의 NGS 활용에 대한 논문으로 사실 작년 2022년 LMCE 발표 준비하면서 잠시 훑어본 내용인데 NGS를 임삼검사실에서 어떻게 활용할 수 있을지에 대해서 이런저런 내용들을 얘기하고 있어서 가져와봤습니다.


2021년 1월달에 출판되었고 제목은 Application of Next Generation Sequencing in Laboratory Medicine이고
DOI: 10.3343/alm.2021.41.1.25 입니다. 

NGS는 기존 1세대시퀀싱에 비해 1bp 염기서열 단위의 해상도로 대규모의 정보를 한번에 분석할 수 있는 기술이죠.  그래서 다음과 같이 암 환자, 유전질환 환자 또는 감염병 환자로 부터 얻어진 시료를 시퀀싱하여 

- 암 환자의 경우, 암의 유형과 치료 반응을 예측 할 수 있고,

- 유전 질환 환자의 경우, 염기서열 또는 유전체 구조적인 이상을 확인하여 질환의 원인 확인 할 수 있고,

- 감염병 환자의 경우, 감염균의 종류와 기존 약제에 대해서 내성을 가지고 있는지 여부 등을 알 수 있습니다.

진단이라는 분야에서는 혁신적이거나 혁명적인지는 언급하기 어렵겠지만 염기서열을 해독하는 시퀀싱이라는 분야에서는 NGS는 단연코 혁신 기술이긴 하죠. 그래서 FDA도 NGS 기반의 진단과 함께 처방하는 치료제(동반진단)에 대해서 승인하기도 하고 있죠. 많은 실험실에서 RWD를 기반으로 NGS 테스트를 더 넓게 활용 할 수 있도록 위해 노력하고 있으니 조만간 더 많은 분야에 사용되지 않을까합니다.

2세대 NGS는 단점이라고 한다면 짧은 read 였는데, 긴 길이의 read를 시퀀싱 할 수 있는 3세대 시퀀싱을 더 다양하게 활용할 수 있고, 실험 방법이나 장비가 고가이며 숙련된 연구원들만 가능한데, 이 부분이 해소되면 더 많은 분야에서 활용 할 수 있을 듯 합니다.





출처 : @ye._.vely618

금요일, 12월 01, 2023

이제 우리 cfDNA를 활용해 보아요 (feat. 머신러닝)


Genome-wide cell-free DNA fragmentation in patients with cancer


"내 혈관 속 DNA가 말해줘"라는 BTS의 DNA의 가사 처럼 우리 혈관 속에는 우리 상태를 알게 해주는 마커로 사용할 수 있는 cfDNA가 있습죠

오늘은 2019년 발표된 "Genome-wide cell-free DNA fragmentation in patients with cancer"라는 논문을 가져와봤습니다.

DOI: 10.1038/s41586-019-1272-6

이 논문은 암환자의 혈액 내 cfDNA를 측정하여 암 진단은 당연하고, 어떤 암종인지, 조기 발견 및 모니터링을 위한 초석을 놓은... 물론 그전에 다른 논문에서 이미 초석을 다진 논문도 있을것 같긴하지만, 어찌됐든 모 괜찮은 논문이라고 생각합니다. :)


그래서 7종의 암환자 200여명과 건강한 (aka 암환자가 아닌) 건강한 사람의 cfDNA을 분석해서 이리저리 굴려보고 돌려보고 해서(결국 머신러닝 아니겠습니까) 암종간 cfDNA의 profile의 변화를 머신러닝을 통해 모델을 만들었고, cfDNA profile 모델과 함께 cfDNA상에 존재하는 변이를 활용하면 더 나은 결과를 보여줬다고 하네요


cfDNA는 원래 혈액속에 있는 암에 걸리면 (무조건은 아니지만) cfDNA의 양이 증가하게 됩니다. 원래 혈액속에 떠다니는 cfDNA가 만들어지는 source외에 암세포가 혈액에 추가로 cfDNA가 더 공급하는 꼴이 되기때문이죠.

cfDNA 중 암세포에서 나온 cfDNA인 ctDNA?만 따로 선별하는 방법으로 접근하기도합니다. 개인적으로는 cfDNA에서 ctDNA를 찾겠다 보다는  cfDNA를 더 잘 characterization 하는게 나을듯한데... cfDNA를 characterization하면 ctDNA를 더 잘 구별할 수 있게 되는건가? 여튼..

아.. 그래서 제가 블로그에 가끔씩 얘기했던 NIPT를 하다가 산모의 암도 찾아냈다고 하는 얘기가 있었기도 했습니다.

오늘은 cfDNA와 머신러닝 방법을 이용해서 암진단 및 암종 구분을 하는 논문에 대해서 잠깐 얘기해보았는데, 분야를 막론하고 머신러닝 모델을 개발할것 까지는 아니지만 활용을 잘 할 수 는 있어야 한다는 느낌은 항상 받는것 같습니다.


23년 12월의 첫날, 아내느님의 탄생일 기념으로 포스팅을 해보았습니다.




출처 : @candyz_hyojung