월요일, 4월 25, 2022

Forensic Microbiome Database


Forensic Microbiome Database: A Tool for Forensic Geolocation Meta-Analysis Using Publicly Available 16S rRNA Microbiome Sequencing

DOI : 10.3389/fmicb.2021.644861



간만에 재미난 제목의 논문이 있어 올려봅니다.

Microbiom Database인데 법의학을 위한...

미생물검체를 시퀀싱한 결과를 분석툴에 돌리고나면 이 미생물검체가 어디서 채취되었는지.. 사람의 어느 부위 또는 지리적 위치와 같은 것을 알려줄수 있는 DB가 있다면 범죄추적에 갱장히 많은 도움을 주겠죠?

그래서 결론은 다양한 분야와 연구자들의 지속적인 데이터 공유로 DB의 업데이트가 필요하니 굽신굽신 (가능하면 다양한 샘플을 정교하게 분류하고 tag 달아서)




미생물을 이용한 법의학하니 옛날에 CSI에서 신발바닥이나 바지밑단 뭍은 물질을 바탕으로 범인의 행동반경이나 직업들을 유추하거나 시체에서 애벌래나 성충이 되는 벌레들을 가지고 대략적인 사망시간 추정 또는 시체가 다른곳에서 유기되었는지도 추측하는 장면이 나왔었는데 만약 미생물 정보를 활용하여 사건 장소나 범인에 대한 정보를 예측할 수 있는 좋은 도구가 될것 같네요

다만 시퀀싱할때마다 시퀀싱되는 종들의 편차가 잘못된 결과를 도출 할 수 있으니 이런 편차나 문제를 극적으로 줄여 줄 수 있는 실험방법이나 분석방법이 나오면 참 좋을듯하네요

간단하게 생각나는 건...
임의의 장소에서 채취된 A검체를 시퀀싱한 결과를 DB에 대고 샘플링(100번 혹은 1000번정도)해서 비교해서 가장 비슷한 DB의 결과를 확률적으로 보여주는 방법 정도?

그리고 Microbiom을 더 정확하게 분류해놓은 DB가 필요하다는.. (사실 모 이건 모든 Microbiom 서비스를 하는 곳에서 요구되는 사항이긴 하지만..)

그리고 이 흥미진진한 내용을 보고 싶으시면 >이곳< 을 방문하시면 될것 같습니다.




그럼 4월 마지막 주를 활활 불태워 보고자 흥미진진한 논문 한번 올려봤습니다. :)




출처: @candyz_hyojung


금요일, 4월 22, 2022

A review of somatic single nucleotide variant calling algorithms for next-generation sequencing data

오랜만에 먼지 뒤집어 쓰고 있던 논문하나... 슬쩍...
somatic mutation call관련해서 누가누가 잘하나 훑어본...
다들 알고 있으신 논문 되겠습니다.



여기서 가장 훌륭한 내용을꼽으라면...
variant caller를 아주 일목요연하게 정리한 Table 1. 되겠습니다. 
(물론 Table 2.도 있습니다.)
이거 보시고 ensemble한 걸 생각하신다면 이전에 소개했었던 appreci8 잊지 않으셨겠죠?

결론적으로 DeepVariant 딥러닝 기반의 성능좋은 caller가 계속해서 나올꺼니 님들 연구 계속 열씸히들 하시고 somatic variant를 검증할 수 있는 데이터셋이 아직 없으니 이거 좀 만들어봐 되지 않을까합니다.

물론 논문에서 언급한 GIAB 프로젝트가 잘 되고 있으니 곧 somatic variant를 검증할 수 있는 set들도 잘 구비되지 않을까 합니다. MAQC/SEQC 프로젝트도 잘 운영되고 있으니..


그리고 뒤적뒤적 거리다 논문 하나를 봤는데.. 

여기 나온 데이터를 가지고 somatic variant pipeline 검증 할 수 있을지는 모르겠지만 그래도 활용은 할 수 있지 않을까 하네요... 한번 뒤적여봐야하겠네요.








출처 : @ye._.vely618


일요일, 4월 17, 2022

pip를 이용한 패키지 설치 그리고 삭제

하도 잘 까먹어서....


python3 -m pip install --user <package name>

python3 -m pip uninstall <package name>


그렇다고 합니다.


ps. 요즘에 cutadapt를 잘 안써서 이번에 알았는데 cutadapt 설치시 ubuntu에서는 apt사용해서 설치 가능하다능...



출처 @ye._.vely618

일요일, 11월 07, 2021

HLA를 빠르고 정확하게 할 수 없을까

그래서 나노포어가 준비했습니다.

절대적으로 빠른 건지, 정확도의 수준은 정확히 모르겠으나 일단 샘플당 $80되겠습니다.
물론 이게 재료비값인지 소비자가인지는.....
아마 본인들이 했을때 가격인듯.... (일반 소비자가 이 가격에 가능할지는 모르겠네요)

Rapid, highly accurate and cost-effective open-source simultaneous complete HLA typing and phasing of class I and II alleles using nanopore sequencing

그럼 HLA(Human leukocyte antigen)검사는 무엇이냐? 쉽게 얘기하면 장기이식할때 장기이식할수 있는지 여부를 확인하는 검사되겠습니다. 이 HLA가 내거와 내거 아닌거를 구분하게 해주는 녀석되겠습니다. 

면역학 책 들춰보시면... 책을 덮습니다.

일반적으로 HLA는 A,B,C인 Class I, DRA1, DRB1/3/4/5, DQA1, DQB1, DPA1, DPB1인 Class II인데 우리나라는 A,B,C를 포함해서 일부만 본다고 합니다. 

여튼 나노포어는 긴 길이로 시퀀싱하는 장점과 빠른 시퀀싱속도를 바탕으로 시퀀싱 시간은 8시간내 (물론 라이브러리 제작시간은... 따로 좀 봐야할것 같습니다.) 분석은 샘플당 30분(근데 사용한 서버 수준이... 32core 256g 메모리 서버)소요 됐다고하는데...

1 샘플(aka 1검체)의 경우 나노포어 한개 사용해서 기존 일루미나나 써모 플랫폼보다 빠르고 싸게 결과를 도출할 수 있도록 해준다는데...

영어의 짧음인지...  가끔 나노포어가 더 안좋아 보이게 설명하는거 같기도합니다. 


결론은 나노포어가 더 길게 시퀀싱하기 떄문에 복잡한 HLA에서 더 정확하게 구별할 수 있고,
기존에 short 시퀀싱에 적합한 pcr primer말고 long range PCR에 적합하게 프라이머를 변경해서 진행하면 HLA의 복잡한 부분들을 더 잘 잡아낼 수 있을것이라고 털고있습니다.


여튼 개인적으로 기존 short 시퀀서 플랫폼 보다는 나노포어가 HLA에서는 좀더 나은 성능을 보여주지 않을까합니다. HLA의 복잡도 때문에 나노포어의 장점을 활용할 수 있는 PCR 프라이머로 재 디자인해서 진행하면 시퀀싱 시간/분석 시간/정확도에서 가장 적합하기 않을까하는 생각입니다.




@ye._.vely618


금요일, 10월 01, 2021

fastq-dump 사용

fastq-dump는 NCBI의 SRA(Sequence Read Archive)에서 fastq를 다운 받을 때 사용하는 명령어로 프로그램을 다운받고자 fastq-dump를 찾으면 딱히 나오는게 별로 없을것이다.

fastq-dump대신 sra-toolkit을 찾아야 fastq-dump를 사용할 수 있는 명령어를 다운받을 수 있다.


다운로드 받을 수 있는 곳은 바로 >여기

OS별로 다운받을 수 있도록 잘 안해하고 있고 어떻게 설치 하는지도 잘 안내되어 있다.

컴파일에 자신있다면 source code를 다운받아 컴파일을 하는것을 권장한다. 그렇지 않다면 걍 컴파일 된 binaries 파일을 다운로드 받아서 사용하자 (정신건강에 좋다).


예전에 그냥 fastq-dump를 사용할 수 있었는데 이번에는 그냥 실행이 안되더라..

vdb-config

라는 명령어를 사용해서 나름의 환경설정을 하고 난 다음에 사용 가능하니 사용에 주의 부탁드립니다. 환경설정라고 해서 딱히 어려운것은 없고 그냥 한번 실행해주고 [Save]하고 나오면 되는 정도..

그럼 fastq-dump를 사용할 수 있게 된다.

>이곳<을 방문하면 NCBI에서 다운 받을 수 있는 리스트들이 나오는데

여기서 SRX로 시작하는 id말고 한번더 링크를 타고 들어가서 보이는 SRR로 시작하는 runid를 확보하면 fastq-dump를 사용하여 내 PC에 fastq 파일을 다운로드 할 수 있다.


sratoolkit.2.x.x-ubuntu64/bin/fastq-dump --split-3 sra_id

이렇게 명령어를 실행하면 실행한 디렉토리에 sra_id_1.fastq sra_id_2.fastq 파일이 짜잔하고 생성된다.



@winterr.aespaa