금요일, 3월 31, 2017
nanonet 사용법
Nanonet Git Hub
Nanopore MinION raw 데이터인 fast5에서 2D read 추출하려고 하는데
nanopore로 검색하면 나오는 poretools, nanopolish, nanook들을 사용했음에도
어느하나 2D 서열을 추출 못하고 있어서 전전긍긍하고 있을때
혜식처럼 나타나는 그분이 알려주신 바로 그 tool!!
nanonet되시겠습니다.
우선 CPU기반으로 사용하였습니다. nanonet은 GPU도 지원하고 있는데
GPU로 하였을때 CPU기반으로 돌렸을 때 확인되던 2D가 나오지 않았다능..
일단 어쩔수 없지만 cpu기반으로 수행
fastq로 저장을 해보자!
$nanonet2d --fastq --jobs 8 --chemistry r9.4 pass output.r94
fasta로 저장을 해보자!
$nanonet2d --jobs 8 --chemistry r9.4 pass output.r94
다른 tools들과 다른 점은 chemistry버전을 선택할 수 있는 것과 무엇인지 모르겠지만 간지나 보이는 trmplate와 complement의 model 선택 옵션
그리고 이를 뒷받침하듯이 nanonettrain명령어도 있고....
poretools같은 일반적인 tools이 안먹힐때는 nanonet도 한번 사용해 보시기 바랍니다. ;)
화요일, 3월 28, 2017
Resolving the Complexity of Human Skin Metagenomes Using Single- Molecule Sequencing
Yu-Chih Tsai et al. mBio 2016; doi:10.1128/mBio.01948-15
동부(Bethesda)와 서부(Pacific Biosciences)의 콜라보 논문
그러나 이참에 Cell 한번 마음대로 써보자 하지 않았다는게 의외의 포인트 (제길.. 놀려줄게 없어 ㅠ.ㅜ)
사람의 피부조직 중 6군데에서 샘플을 채취하는데 보여줄때는 크게 팔 (3군데)과 발 (3군데)를 샘플링을
해서 SMRT와 HiSeq 시퀀싱
- 니네 반복없니? 반복은 너님들이나 신경쓰는 거 Orz
근데 팔쪽 SMRT가 폭망해서 Human 필터링 하니 20M정도 나왔다는거 제외하고는 HiSeq과 발 SMRT는 잘 나와줘서 하단의 멋진 Figure 시전. ㅠ.ㅜ
디스플레이 하나는 이쁘게 잘하네.. ㅠ.ㅜ
간단히 얘기해서 HiSeq으로는 못잡는거 있다(물론 그 반대도 있다는게 함정이지만..).
그래서 HiSeq이 위대하긴 했는데 SMRT로도 HiSeq하는거 확인 할 수 있고 어떤 부분에서는 더 정확하게 표현해 줄 수 있다라는 것을 여지없이 보여주고 있습니다(상단 그림에서 D 파트 되겠습니다).
그리고 이 논문에서 저자가 참고할만한 Figure는 바로 이것!
현재 iHMP의 Assembly SOP의 tools은 SOAPdenovo인데 음.. 이거 봐서는 SPAdes도 나쁘지 않다고 생각되네요..
Long read있다고 어설프게 Hybrid 한다고 깝치지 말고 HiSeq으로 SPAdes 도 나쁘지 않겠네라는 본인 생각 되겠습니다.
대신 속도는 확실히 SOAPdenovo가 빠릅니다.
논문 결론은 당신이 알고 내가 알고 있다 싶이 SMRT 자랑되겠습니다.
근데 문제는 효율이 좋아져서 그냥 자랑질이 아니라는게.. Orz
쓰고 싶은데 돈이 없어.. ㅠ.ㅜ
그래서 우리는 SMRT랑 HiSeq으로 박테리아 말고 바이러스랑 곰팡이도 같이 봤고 덤으로 Corynebacterium simulans라는 균은 closed genome서열도 확보도 할 수 있다능!
물론 TSLR이라는 일루미나라는 기술도 있지만 증폭해야되서 bias가 예상되는데 우리 SMRT는 증폭-Free라서 괜찮음(물론 이건 님들 의견, 물론 나한테는 반박 자료가 없다는게 현실 ㅠ.ㅜㅋ)
금요일, 3월 24, 2017
Ubuntu에서 시스템 정보 확인
출처: Getting your Dell service tag number from command line in Ubuntu
조립식이던 Vendor PC나 서버를 사용할 때
스펙이 어떻게 되는지 이따금씩 궁금할때가 있다.
그럴때 필요한 명령어 dmidecode!
근데 그냥 dmidecode를 실행시키면 모 그냥 주저리 주저리 내용이 나온다.
그중에 내가 보고 싶은 내용만 추려서 볼 수 없을까?
있다!
dmidecode의 --type와 --string 옵션 근데 type이 무엇인지 어떤 string을 넣어야 하는지 모르지 않은가!!
다행히 다음과 같이 실행시키면 검색 가능한 keyword들을 확인 할 수 있다.
$dmidecode --typetype으로 검색 가능한 문자열들을 확인 할 수 있다.
$dmidecode --stringstring으로 검색 가능한 문자열들을 확인 할 수 있다.
본인의 예로 DELL서버의 Service Tag를 확인하고 싶은데
맨날 랙을 열고 봐야하는 수고로움이 여간 귀찮은게 아니다.
검은 창을 보고 다음과 같이 주문을 외워보자.
$sudo dmidecode -s system-serial-number
화요일, 3월 21, 2017
Human Microbiome Project 2
Whole Metagenome 관련 작업하느라
우리 선두주자이신 미쿡언니옵빠들은 무엇을 쓰나
염탐하고 있는데
우리 미쿡 언니옵빠들 phase마다 사이트만드는 통에
다른곳에서 삽질은 했나 싶었는데...
다행히.... 업데이트내용이 없어서 삽질은 아니었던듯..
Human Microbiome Project 1
Human Microbiome Project 2
음... 근데 왜 phase 1하고 2를 다시 만드셨는지..
주관 기관이 변경된건가??
여튼 다행인지 얘네들이 업데이트를 안한건지 SOP는 크게 안바뀐듯....
불행 중 다행인건지...
아니면 얘네도 정신이 없는건지..
우리 선두주자이신 미쿡언니옵빠들은 무엇을 쓰나
염탐하고 있는데
우리 미쿡 언니옵빠들 phase마다 사이트만드는 통에
다른곳에서 삽질은 했나 싶었는데...
다행히.... 업데이트내용이 없어서 삽질은 아니었던듯..
Human Microbiome Project 1
Human Microbiome Project 2
음... 근데 왜 phase 1하고 2를 다시 만드셨는지..
주관 기관이 변경된건가??
여튼 다행인지 얘네들이 업데이트를 안한건지 SOP는 크게 안바뀐듯....
불행 중 다행인건지...
아니면 얘네도 정신이 없는건지..
화요일, 3월 14, 2017
poretools 사용법
poretools doc사이트
poretools git url
Oxford Nanopore 데이터 핸들링을 위한 tools중 하나로
현재 다양한 nano로 시작하는 tools들이 있긴 하지만
우선 이 tools을 먼저 살펴보았습니다.
이유는 간단합니다. 제가 사용하고 있으니 작업 로그 삼아 글쓰는거죠 ㅎㅎ
설치는 간단합니다.
먼저 poretools에 필요한 hdf5, numpy, cython 라이브러리들을 설치해 주시고
다음과 같이 샤샤샥
물론 위는 root권한이 있어야 가능하고요
저같은 일반 유저들은 다음과 같이 해야겟죠(물론 이런 저런 라이브러리는 알아서 잘 설치를...)
poretools는 nanopore read 추출/통계정도의 작업제외하고는 할 수 있는게...
그래서 여기서는 extract read관련한것만 간단히 적고자 합니다.
nanopore데이터는 hdf5로 PacBio와 format이 유사해서 직접 데이터를 확인 할 수 없습니다.
그래서 fasta파일이나 fastq파일로 추출 작업을 거쳐야 합니다.
다행히 추출 방법은 그리어렵지 않습니다(사실 어려울게 없죠).
poretools {fasta|fastq} /path/to/reads/pass/ > reads.{fa|fq}
이렇게 하면 fast5파일에서 fasta나 fastq정보를 추출해서 파일로 만들어 줍니다.
근데 nanopore보시다 보면 1D다 2D다 이상한 얘기를 하는것을 볼 수 있습니다.
1D, 2D는 sequence type입니다. 쉽게 얘기해서 1D는 한번 읽고 2D는 두번 읽은거
그래서 2D가 먼데? 요기
그러면 2D 서열은 어떻게 추출하는건가?
다음과 같이 각 type에 따라 저장 할 수 있습니다.
poretools {fasta|fastq} --type {all|fwd|rev|2D|fwd,rev|best} /path/to/reads/pass/ > reads.{fa|fq}
poretools git url
Oxford Nanopore 데이터 핸들링을 위한 tools중 하나로
현재 다양한 nano로 시작하는 tools들이 있긴 하지만
우선 이 tools을 먼저 살펴보았습니다.
이유는 간단합니다. 제가 사용하고 있으니 작업 로그 삼아 글쓰는거죠 ㅎㅎ
설치는 간단합니다.
먼저 poretools에 필요한 hdf5, numpy, cython 라이브러리들을 설치해 주시고
다음과 같이 샤샤샥
git clone https://github.com/arq5x/poretools물론 이렇게 해서 한큐에 되는 경우는 그렇게 많지는 않죠..
cd poretools
python setup.py install
물론 위는 root권한이 있어야 가능하고요
저같은 일반 유저들은 다음과 같이 해야겟죠(물론 이런 저런 라이브러리는 알아서 잘 설치를...)
git clone https://github.com/arq5x/poretools그럼 일단 큰 문제 없이 설치는 될 겁니다.
cd poretools
python setup.py install --home=/path/to/install
poretools는 nanopore read 추출/통계정도의 작업제외하고는 할 수 있는게...
그래서 여기서는 extract read관련한것만 간단히 적고자 합니다.
nanopore데이터는 hdf5로 PacBio와 format이 유사해서 직접 데이터를 확인 할 수 없습니다.
그래서 fasta파일이나 fastq파일로 추출 작업을 거쳐야 합니다.
다행히 추출 방법은 그리어렵지 않습니다(사실 어려울게 없죠).
poretools {fasta|fastq} /path/to/reads/pass/ > reads.{fa|fq}
이렇게 하면 fast5파일에서 fasta나 fastq정보를 추출해서 파일로 만들어 줍니다.
근데 nanopore보시다 보면 1D다 2D다 이상한 얘기를 하는것을 볼 수 있습니다.
1D, 2D는 sequence type입니다. 쉽게 얘기해서 1D는 한번 읽고 2D는 두번 읽은거
그래서 2D가 먼데? 요기
그러면 2D 서열은 어떻게 추출하는건가?
다음과 같이 각 type에 따라 저장 할 수 있습니다.
poretools {fasta|fastq} --type {all|fwd|rev|2D|fwd,rev|best} /path/to/reads/pass/ > reads.{fa|fq}
수요일, 3월 08, 2017
PacBio Sequel System
Sequel에 대한 자세한 내용은 Here 를 보시면 더 자세히
알수 있을 것이고...
2017년 3월 8일 기준 어제인 3월 7일 K호텔에서 PacBio 워크샵이 있었는데
Sequel 출시 이후 다양한 업그레이들이 진행되고 있었네요..
그리고 국내에 Sequel이 3?대인지는 모르겠으나 3개의 site에는 들어와서
데이터가 생산되고 있다능..
여튼 기존에 150만개 hole에서 생산되던걸 1천만개 hole에서 생산해서
생산량이 좀 되서 multiplexing이 된다는게 엄청나진 않지만 나름 진일보..
RSII는 생산량이 적은 관계로 multiplexing의 필요와 이유도 없었는데
Sequel은 RSII 6-7Cell을 한번에 돌리는거니깐 multiplexing이 필요해진듯
근데 multiplexing에 이용되는 barcode가 384개라는게 (Barcode 관련 웹페이지) ㅋ
모 종류가 384개지 이걸 꼭 다 써야하는건 아니니... 혹시 몰라서 여분의 barcode를... (여분이 좀 많은게.. ㅎㅎ)
- de novo Bacteria는 Sequel에 5개 pooling해서 시퀀싱해도 나름 괜찮은 결과가 나올듯 물론 RSII 1 Cell과 Sequel 1 Cell과 가격을 비교해봐야겠지만..
- 곰팡이는 1 Cell만 돌려도 de novo하기에 충분한 output이 나오게된 상황 (대신 라이브러리를 2-3개 만들어서 pooling해서 sequencing). 가격을 봐야겠지만 곰팡이 community는 충분한 매리트가 생긴듯...
- Iso-seq은 RSII는 최소 3개 cell 가지고 시퀀싱써야했는데 이제 multiplexing되니깐 3종류 만들어서 Sequel 1 Cell에 넣어버리면 OK 된듯.. 3반복하려면 단지 3개 셀!! (이라고 쓰고 라이브러리는 3개 아닙니다 고갱님 ㅋ)
여튼 NovaSeq과 MinION이 계속 PacBio의 똥꾸멍을 찔러대고
투자자는 돈 회수하고 있어도 기술적으로 봤을때는
아직까지는 쓸만한...
그리고 현 시점에서 대한민국에 국한되어있지만
PacBio 인기가 시들하다고 할 수 있을까...
PacBio 시퀀싱 의뢰하면 지금이 3월 8일인데 4월 중순이후에야 raw data를 받을 수 있는 현실!!!
대규모 과제에서 PacBio sequencing 요청이나
누군가 휴먼급 genome을 RSII Only로 de novo을 하거나...
아님 둘 모두...
아놔 좀 큰놈들은 Sequel 쓰라고 Sequel 만들었는데 왜 RSII 쓰냐고 ㅋ
피드 구독하기:
글 (Atom)

