denovo RNA-Seq를 사용해서 조립을 했다면
조립된 서열들은 어떤 유전자인지 궁금해 지겠쥬?
안 궁금하면 그냥 끝! 하고
서열을 NCBI에 fastq파일 디파짓하고 Bye さようなら하면
그냥 남 좋은일 하는 겁니다.
(나는 대인배다 나는 시퀀싱 비용이 아깝지 않다 하시는 분이라면
친하게 지내요!! 제발~ )
여튼 RNA-Seq을 했고, 생산된 RNA-Seq을 가지고 조립까지 했다면
조립된 서열들은 어떤 유전자들일까 궁금한게 인지사정!
그러면 그런 tool에서는 어떤 것들이 있을까?
바로 이런게 있습니다.
TransDecoder
TransDecoder Wiki
조립된 RNA-Seq서열 에서 coding 서열을 찾아주는 프로그램 입니다.
(현재 버전이 5.5.0이네요.. 다행히 어떤 업데이트도 일어나지 않았네요..)
풋 아마추어같이 RNA-Seq서열이니깐 ATG로 시작하는 것 찾으면 되지 무슨 프로그램이야 프로그램은 아마추어 같으니라고!!
라고 하신다면 당신은 느응력자!
다들 알고계시다 싶이 ATG로 시작하는 것들 major긴 하지만 RNA-Seq을 해서 조립하게되면 ATG로 시작하지 않은 partial로 어딘가가 짤려진 gene 서열들이 존재하기 때문에 그런것들도 잘 알아서(모 대략, 못찾는것도다는) 찾아주는 녀석이 바로 이녀석 되겠습니다.
-사실 이거 말고 다른것도 많이 있을겁니다. 제가 이것밖에 안써서 이거 소개합니다. ㅎㅎ
그냥 위에 파일 다운 받아서 압축 풀고 trinity로 조립한 fasta파일을 넣고 돌리면
$ ~/TransDecoder-TransDecoder-v5.5.0/TransDecoder.LongOrfs -t Trinity.fasta --gene_trans_map Trinity.fasta.gene_trans_map
금요일, 10월 25, 2019
수요일, 10월 23, 2019
산모의 건강상태가 NIPS에 미치는 영향
간만에 하는 업무와 갱장히 밀접한 글 하나 투척이라기 보다는
간단히 정리 정도...
NIPS/NIPT, 비침습적 산전 스크리닝 혹은 테스트의 약자로 산모의 혈액내에 있는 태아의 cfDNA를 사용하여 태아에 문제가 있는지 확인 할 수 있는 기술로써 홍콩대학의 Denis Lo 옹께서 산모 혈액내에 태아것도 있다. 그리고 산모와 태아의 것을 구분 할 수 있다고 밝혀주셔서 전세계적으로 빠르게 확산되었죠.
지속적인 연구를 통해 Trisomy 13/18/21에 대해서 우수한 정확도를 보여주고 있습니다만, NIPS/NIPT를 하다보면 이게 검사가 잘 안되는 경우가 있습니다.
그러나 어떠한 이유인지 분석 할 수 없는 경우나 알 수없가 없었습니다.
그래서 지속적으로 축적된 임상 경험을 바탕으로 NIPS/NIPT와 산모의 건강과 관련하여 상호관계가 있을것으로 추측하였고 그래서 한번 어떤 것들이 NIPS/NIPT의 성능에 영향을 미치는지 조사해본 논문하나를 살펴보았습니다. :)
산모의 비만 (Obesity)
NIPS/NIPT를 할 때 의뢰서에 키와 몸무게 란이 있습니다. 이는 BMI이 치수로 산모의 체질량을 확인하는데 BMI가 높을수록 NIPS/NIPT에 필요한 태아의 cfDNA의 비율이 떨어지기 떄문에 NIPS/NIPT가 실패할 확률이 높아진다고 보고되고 있습니다.
지방세포에서 세포 사멸과 괴사로 혈중 내 태아의 cfDNA보다 산모의 cfDNA 양이 상승하여 태아의 cfDNA 비율을 떨어트린다는 것입니다.
자가면역질환 (Autoimmune disease)
자가면역질환은 문자 그대로 자기 자신을 공격하는 질환으로 세포 주기가 굉장히 짧아지는것이 문제가 되어 임신하지 않은 전신성 홍반성 루프스(SLE) 환자에서 혈중 cfDNA가 증가하는 것을 확인했습니다. 그래서 SLE가 있는 임산부의 NIPS/NIPT결과를 해석할 때는 주의를 기울여야 한다고 말하기도 하였습니다.
태아 분획에 영향을 줄 수 있는 것들 (Other maternal influences on fetal fraction)
표2(논문 참조)에 나와있듯이 태아 분획과 다양한 산모의 특징(인종, 흡연여부, 고혈압, 나이등등등)들은 통계적으로 유의한 연관성을 가지고 있으나 이러한 산모의 특징들은 상반된 결과를 나타내는 결과들도 있기 때문에 덜 중요해 보인다고 합니다.
(인종 ㅂㄷㅂㄷ, ㅂㄷㅂㄷ 했다고 인종차별자는 아니니 오해 없으시기 바랍니다.)
산모가 받은 처방 (Maternal medications)
산모가 복용하는 약 또한 NIPS/NIPT의 결과를 방해 할 수 있습니다.
LMWH(Low molecular weight heparin)은 NIPS/NIPT에 부정적인 영향을 미치는 첫 물질이었습니다. heparin과 NIPS/NIPT의 부정적인 결과에 대해서 정확한 메카니즘은 알려져 있지 않지만 NIPS/NIPT 검사를 위해서는 heparin 복용을 일정 시간 중단해야 합니다. 그리고 IVIG(Intravenous immunoglobulin)의 경우 cfDNA가 증가하는 것처럼 보고 되었지만 NIPT의 분석 성능에는 확인되지 않았습니다.
장기 이식 받은 산모 (Organ transplant recipients)
장기 이식을 받은 산모의들의 NIPS/NIPT는 고려를 해봐야 합니다. 특히나 장기 이식받은 장기가 남성 기증자라면 특히나 주의해야한다. 남성 기증자의 장기는 Y염색체 특이적 cfDNA서열을 만들어내어 잘못된 판단을 유발 할 수도 있다. 그리고 NIPS/NIPT는 염색체 이상이 있는 산모가 하면 정확하지않은 결과를 받아볼 수 있기 때문에 NIPS/NIPT 전 상담을 꼭 진행해야 합니다.
※ 정정 :하단은 NIPS/NIPT를 해서 산모로부터 우연히 알게되는 것에대한 내용입니다.
산모의 성염색체 상태 (Maternal sex chromosome conditions)
NIPS/NIPT에서 X염색체의 정확도는 13/18/21과 같은 상염색체보다 본질적으로 좋지 않습니다. 다른 이수성에 비해 X 염색체 이상에 대해 더 높은 태아 및 태반 모자이크 현상이 있습니다. 산모에 따라 나이와 연관있는 X 염색체 손실이 일어나기도 하고 일부 산모에게서는 정상 XX에서 저수준으로 XO/XX 모자이크로 바뀌기도 합니다.또한 많은 SCA(Sex chromosome aneuploidies)는 불확실한 NIPS/NIPT결과를 초래하기도 합니다. NIPS/NIPT에 의해 의심된 181개 SCA case중 16 case (8.5%)가 산모에 의해 기인한 것으로 확인되었다고 합니다.
산모의 상염색체 이상 (Maternal autosomal abnormalities)
산모의 상염색체이상도 잘못된 NIPS/NIPT 결과를 발생시킵니다. 이런 경우 산모가 저수준의 모자이크 T18이나 염색체 13 혹은 18번에 부분적으로 중복이 있어 발생할 수 있습니다. 최근 NIPS/NIPT 분석 중에 22q11.2와 같은 미세결실 증후군을 탐지하고 있는데 한 연구에서 고위험의 미세 결실 결과 중 60%(20 case/32 case)가 산모에 의한 것이지 않을까 의심되고 있습니다. 그러나 다른 NIPS/NIPT 제공 업체의 경우 고위험 미세 결실 결과중 2%만이 산모에 의한 것으로 확인(?이 진짜 된건지 산모를 검사를 했는지는 까지는)됐다고 합니다. 그런데 이런 차이가 나는 이유는 NIPS/NIPT분석 방법이나 reference의 편향성이나 인구 특징들에 따라 달라지기 때문에 분석 결과에 대한 비교까지는 어려운것 같다고 합니다.
산모의 종양 (Maternal malignancy)
종양세포는 NIPS/NIPT 분석에 사용하는 혈장내의 cfDNA를 기여하고 있다는 것에 누구도 부정은 못할 것 입니다. 종양이 NIPS/NIPT 결과에 영향을 준다는 사례 보고는 여기에서 설명되었습니다. 125,426명의 산모 집단에서 산모의 종양으로 인해 NIPS/NIPT결과가 불일치한 산모 10명에 대해서 정보를 공개했습니다. 산모들의 종양/암 유형은 lymphoma, leukaemia, colorectal and anal cancers 이었다고 합니다.
그리고 산모들은 추가적인 생물정보학적 분석으로 비특이적인 CNV들을 보여줬는데 NIPS/NIPT에서 관찰된 비특이적인 패턴들은 종양/암 치료후 사라져서 종양/암과 NIPS/NIPT와의 관계를 확인 할 수 있었습니다.
그래서 종합적으로 요약하자면 임상적으로 NIPS/NIPT에 대한 경험과 자료가 증가함에 따라 산모의 건강과 밀접한 관련이 있다는 것을 확인 할 수 있었고 비만, 면역질환 및 LMWH 치료와 같은 NIPS/NIPT 결과에 영향을 줄 수 있는 산모의 상태에 대해서 인지하고 있어야합니다(안그러면 위양성 결과를 받아들고 옳지못한...).
NIPS/NIPT결과로 얻어진 2차 산모의 위험 소견에 대해 산모에게 알리는 것도 중요한 윤리적 고려사항이라고 생각됩니다.
이렇다고합니다.
간만에 업무와 관련되 내용 포스트 좀 해봤습니다.
라벨:
사나,
트와이스,
cell-free DNA,
cfDNA,
fetal cell-free DNA,
fetal fraction,
NIPS,
NIPT,
Noninvasive,
Prenatal,
SANA,
Screening,
Test,
TWICE
월요일, 10월 21, 2019
bam파일을 가장 쌈빡하게 잘 다루는 방법
NGS 시대를 살면서 bam파일은 어떻게 땔래야 땔수없는
껌딱지같은 녀석이 되어버렸습니다.
다양한 정보를 가지고있기는 한데 그 안에서 정보를 추출같은 핸들링하기가 쉽지 않은게 사실이긴 합니다.
그래서 여기 sam파일 bam파일을 samtools보다 빠르게 처리해주는 툴하나
가지고 와봤습니다.
모 이미 samtools대신에 잘 사용하고 계실겁니다.
sambamba라고 (현재 버전은 v0.7.0 입니다. 논문은 여기에 있습니다.)
sambamba는 samtools와 비슷한 대부분의 기능을 가지고 있습니다.
view, sort, index, merge, slice, flagstat, markdup
그리고 사용법도 모 크게 어렵지 않습니다. :)
sambamba documentation을 보시면 모 크게 어렵지 않게 손쉽게 사용하실 수 있을겁니다. :)
껌딱지같은 녀석이 되어버렸습니다.
다양한 정보를 가지고있기는 한데 그 안에서 정보를 추출같은 핸들링하기가 쉽지 않은게 사실이긴 합니다.
그래서 여기 sam파일 bam파일을 samtools보다 빠르게 처리해주는 툴하나
가지고 와봤습니다.
모 이미 samtools대신에 잘 사용하고 계실겁니다.
sambamba라고 (현재 버전은 v0.7.0 입니다. 논문은 여기에 있습니다.)
sambamba는 samtools와 비슷한 대부분의 기능을 가지고 있습니다.
view, sort, index, merge, slice, flagstat, markdup
그리고 사용법도 모 크게 어렵지 않습니다. :)
sambamba documentation을 보시면 모 크게 어렵지 않게 손쉽게 사용하실 수 있을겁니다. :)
![]() |
| 출처: sana_twice.09 |
금요일, 10월 18, 2019
Trimmomatic 설치 및 사용
Trimmomatic Site
Trimmomatic Manual
Trimmomatic은 cutadapt와 함께 Illumina 시퀀서들의 adapter들을 제거하고 trimming하는데 널리사용되는 tool되겠습니다.
설치방법은..
>wget http://www.usadellab.org/cms/uploads/supplementary/Trimmomatic/Trimmomatic-0.36.zip
>unzip Trimmomatic-0.36.zip
Trimmomatic-0.36폴더 밑에 파일 생성
>cd Trimmomatic-0.36
>java -jar trimmomatic-0.36.jar -h
참 쉽죠!!
물론 java가 설치되어 있어야한다는게 함정
Quick Start
Paired End일때
java -jar trimmomatic-0.35.jar PE -phred33 input_forward.fq.gz input_reverse.fq.gz output_forward_paired.fq.gz output_forward_unpaired.fq.gz output_reverse_paired.fq.gz output_reverse_unpaired.fq.gz ILLUMINACLIP:TruSeq3-PE.fa:2:30:10 LEADING:3 TRAILING:3 SLIDINGWINDOW:4:15 MINLEN:36
Single End일때
java -jar trimmomatic-0.35.jar SE -phred33 input.fq.gz output.fq.gz ILLUMINACLIP:TruSeq3-SE:2:30:10 LEADING:3 TRAILING:3 SLIDINGWINDOW:4:15 MINLEN:36
위의 Quick Start에서 사용한 내용은 paired와 single 차이일뿐 옵션은 동일합니다.
찬찬히 뜯어보면 다음과 같다고 하네요
ILLUMINACLIP:TruSeq3-PE.fa:2:30:10
- 일루미나 아답타 서열을 제거하는 옵션입니다. 자세한 내용은 하단에..
LEADING:3
- 서열의 앞쪽을 기준으로 quality (여기서는 3) 이하의 N개 서열을 제거합니다.
TRAILING:3
- 서열의 뒤쪽을 기준으로 설정한 quality (여기도 3) 이하의 N개 서열을 제거합니다.
SLIDINGWINDOW:4:15
- 4base씩 확인하면서 평균 quality가 설정된 기준 quality (여기서는 15)보다 이하일 경우 제거합니다.
MINLEN:36
- 위의 단계들을 거치면서도 살아 남은 서열 길이가 기준 길이 (여기서는 36bp)보다 짧으면 (이하) 아예 read를 삭제합니다.
사용 가능한 옵션
ILLUMINACLIP:<fastaWithAdaptersEtc>:<seed mismatches>:<palindrome clip threshold>:<simple clip threshold>
- fastaWithAdaptersEtc: trimmomatics에서 TruSeq2와 TruSeq3서열은 제공하고 있고 그외에 아답터 서열을 사용하고 싶으면 fa파일을 넣어주면 됨
- seed mismatches: 허용가능한seed 서열의 mismatch 개수
- palindrome clip threshold: palindrome trimming방법은 Paired End로 시퀀싱을 했을 때 적용할 수 있는 방법으로 아답타 서열이 traget read 앞뒤에 존재해서 첫번째 read와 두번째 read에서 역 상보적으로 동일한 read들이 발견되는 경우 해당 서열들을 삭제하는 방법입니다. (참고 palindrome란? )
- simple clip threshold: 설정된 기준 값에 부합하는 충분히 정확한 match가 확인되면 적절히 clipping함
SLIDINGWINDOW:<windowSize>:<requiredQuality>
설정된 windowSize 서열들의 평균 qaulity가 requiredQuality 값보다 작아지면 작아진 서열들 이후를 제거합니다.
LEADING:<quality>
read 앞쪽을 기준으로 설정된 quality보다 낮은 quality를 가진 서열들을 제거합니다.
TRAILING:<quality>
read 뒤쪽을 기준으로 설정된 quality보다 낮은 quality를 가진 서열들을 제거합니다.
CROP:<length>
read 앞쪽을 기준으로 설정된 length만큼 서열들을 보존한다.
HEADCROP:<length>
read 앞쪽을 기준으로 설정된 length만큼 서열을 삭제한다.
MINLEN:<length>
TOPHRED33 quality를 phread 33으로 변환
TOPHRED64 quality를 phread 64으로 변환
그리고 중요한 점 하나! trimmomatic는 옵션에 순서가 있다는 사실! 저도 아직 테스트 해보지는 못했는데 옵션이 순서대로 적용 된다고 합니다. 설명서에 그렇게 써 있으니 맞겠죠. 그래서 일단 어답터 서열을 먼저 제거하라고 합니다. :)
그럼 즐거운 trimming 작업 되시길..
Trimmomatic Manual
Trimmomatic은 cutadapt와 함께 Illumina 시퀀서들의 adapter들을 제거하고 trimming하는데 널리사용되는 tool되겠습니다.
설치방법은..
>wget http://www.usadellab.org/cms/uploads/supplementary/Trimmomatic/Trimmomatic-0.36.zip
>unzip Trimmomatic-0.36.zip
Trimmomatic-0.36폴더 밑에 파일 생성
>cd Trimmomatic-0.36
>java -jar trimmomatic-0.36.jar -h
참 쉽죠!!
물론 java가 설치되어 있어야한다는게 함정
Quick Start
Paired End일때
java -jar trimmomatic-0.35.jar PE -phred33 input_forward.fq.gz input_reverse.fq.gz output_forward_paired.fq.gz output_forward_unpaired.fq.gz output_reverse_paired.fq.gz output_reverse_unpaired.fq.gz ILLUMINACLIP:TruSeq3-PE.fa:2:30:10 LEADING:3 TRAILING:3 SLIDINGWINDOW:4:15 MINLEN:36
Single End일때
java -jar trimmomatic-0.35.jar SE -phred33 input.fq.gz output.fq.gz ILLUMINACLIP:TruSeq3-SE:2:30:10 LEADING:3 TRAILING:3 SLIDINGWINDOW:4:15 MINLEN:36
위의 Quick Start에서 사용한 내용은 paired와 single 차이일뿐 옵션은 동일합니다.
찬찬히 뜯어보면 다음과 같다고 하네요
ILLUMINACLIP:TruSeq3-PE.fa:2:30:10
- 일루미나 아답타 서열을 제거하는 옵션입니다. 자세한 내용은 하단에..
LEADING:3
- 서열의 앞쪽을 기준으로 quality (여기서는 3) 이하의 N개 서열을 제거합니다.
TRAILING:3
- 서열의 뒤쪽을 기준으로 설정한 quality (여기도 3) 이하의 N개 서열을 제거합니다.
SLIDINGWINDOW:4:15
- 4base씩 확인하면서 평균 quality가 설정된 기준 quality (여기서는 15)보다 이하일 경우 제거합니다.
MINLEN:36
- 위의 단계들을 거치면서도 살아 남은 서열 길이가 기준 길이 (여기서는 36bp)보다 짧으면 (이하) 아예 read를 삭제합니다.
사용 가능한 옵션
ILLUMINACLIP:<fastaWithAdaptersEtc>:<seed mismatches>:<palindrome clip threshold>:<simple clip threshold>
- fastaWithAdaptersEtc: trimmomatics에서 TruSeq2와 TruSeq3서열은 제공하고 있고 그외에 아답터 서열을 사용하고 싶으면 fa파일을 넣어주면 됨
- seed mismatches: 허용가능한seed 서열의 mismatch 개수
- palindrome clip threshold: palindrome trimming방법은 Paired End로 시퀀싱을 했을 때 적용할 수 있는 방법으로 아답타 서열이 traget read 앞뒤에 존재해서 첫번째 read와 두번째 read에서 역 상보적으로 동일한 read들이 발견되는 경우 해당 서열들을 삭제하는 방법입니다. (참고 palindrome란? )
- simple clip threshold: 설정된 기준 값에 부합하는 충분히 정확한 match가 확인되면 적절히 clipping함
SLIDINGWINDOW:<windowSize>:<requiredQuality>
설정된 windowSize 서열들의 평균 qaulity가 requiredQuality 값보다 작아지면 작아진 서열들 이후를 제거합니다.
LEADING:<quality>
read 앞쪽을 기준으로 설정된 quality보다 낮은 quality를 가진 서열들을 제거합니다.
TRAILING:<quality>
read 뒤쪽을 기준으로 설정된 quality보다 낮은 quality를 가진 서열들을 제거합니다.
CROP:<length>
read 앞쪽을 기준으로 설정된 length만큼 서열들을 보존한다.
HEADCROP:<length>
read 앞쪽을 기준으로 설정된 length만큼 서열을 삭제한다.
MINLEN:<length>
TOPHRED33 quality를 phread 33으로 변환
TOPHRED64 quality를 phread 64으로 변환
그리고 중요한 점 하나! trimmomatic는 옵션에 순서가 있다는 사실! 저도 아직 테스트 해보지는 못했는데 옵션이 순서대로 적용 된다고 합니다. 설명서에 그렇게 써 있으니 맞겠죠. 그래서 일단 어답터 서열을 먼저 제거하라고 합니다. :)
그럼 즐거운 trimming 작업 되시길..
![]() |
| @sana_twice.09 |
라벨:
사나,
트와이스,
ILLUMINACLIP,
JAVA,
LEADING,
MINLEN,
PE,
SANA,
SE,
SLIDINGWINDOW,
TRAILING,
Trimmomatic,
TWICE
수요일, 10월 16, 2019
메타지놈은 kaiju와 함께
코펜하겐에 계시는 이름좀 들어본 A. Krogh옹이 속한 팀(저자가 2명인건 비밀)에서 출판한 메타지놈 classification 분석 툴인 kaiju (1저자님이 퍼시픽림좀 보신듯.. 그럼 kaiju이후 analysis pipeline은 jager인건가)에 대해서 잠시 얘기해 보도록 하겠습니다.
웹서버 : http://kaiju.binf.ku.dk/
논문 : Fast and sensitive taxonomic classification for metagenomics with Kaiju
현재 kaiju버전 : https://github.com/bioinformatics-centre/kaiju/releases/tag/v1.7.1
모 이제 metagenome이야 쩔 핫해요라는거는 일주일에 한두번은
수십억 L. 로 시작하는 미생물들을 우리 입안에 털어넣고 있는이상 따로 말해야하는가?
그렇지만 아직도 연구할건 많다는건 비밀이라서
많은 연구자들이 다양한 연구를 하기위해 이것저것 시도를 할 때
사용할 도구들을 계속 만들고 있는데 이 kaiju 또한 그런 도구중 하나 되겠습니다.
모 아이디어는 기존에는 DNA read를 었어서 DNA랑 비교했는데
우리 그러지 말고 단백질 조각이랑 비교하면 어떻겠니? 하는 논문 되겠습니다.
결론: DNA-DNA 비교 하지말고 DNA-Protein비교가 더 좋지? 되겠습니다.
그리고 위의 그림으로만 믿지 못하는 (저같은) 닝겐들을 위해서
그럼 너님들을 위해서 real 샘플에서 결과를 보여주지 훗
기대하시라고!
추가적으로 전세계적으로 NGS는 일루미나느님이 잡고 있다보니 저자분들께서
HiSeq(Short)과 MiSeq(Long)에 대해서 kaiju와 kreken으로 비교해두었습니다.
HiSeq에서는 두 프로그램의 sensitivity나 precision은 별로 차이가 없었고 MiSeq결과에서는 그래도 (phylum 수준에서나마) kaiju(그냥도 아니고 greedy-5 모드)가 karken보다 조금더 높은 sensitivity와 precision을 보여준다고 합니다.
결론은 Microbiome은 MiSeq으로 대동단결(진정 MiSeq밖에 없는것인가.. Orz)
웹서버 : http://kaiju.binf.ku.dk/
논문 : Fast and sensitive taxonomic classification for metagenomics with Kaiju
현재 kaiju버전 : https://github.com/bioinformatics-centre/kaiju/releases/tag/v1.7.1
모 이제 metagenome이야 쩔 핫해요라는거는 일주일에 한두번은
수십억 L. 로 시작하는 미생물들을 우리 입안에 털어넣고 있는이상 따로 말해야하는가?
그렇지만 아직도 연구할건 많다는건 비밀이라서
많은 연구자들이 다양한 연구를 하기위해 이것저것 시도를 할 때
사용할 도구들을 계속 만들고 있는데 이 kaiju 또한 그런 도구중 하나 되겠습니다.
모 아이디어는 기존에는 DNA read를 었어서 DNA랑 비교했는데
우리 그러지 말고 단백질 조각이랑 비교하면 어떻겠니? 하는 논문 되겠습니다.
![]() |
| 걍 제일 중요한 Figure |
그리고 위의 그림으로만 믿지 못하는 (저같은) 닝겐들을 위해서
그럼 너님들을 위해서 real 샘플에서 결과를 보여주지 훗
기대하시라고!
![]() |
| 됐냐? |
추가적으로 전세계적으로 NGS는 일루미나느님이 잡고 있다보니 저자분들께서
HiSeq(Short)과 MiSeq(Long)에 대해서 kaiju와 kreken으로 비교해두었습니다.
HiSeq에서는 두 프로그램의 sensitivity나 precision은 별로 차이가 없었고 MiSeq결과에서는 그래도 (phylum 수준에서나마) kaiju(그냥도 아니고 greedy-5 모드)가 karken보다 조금더 높은 sensitivity와 precision을 보여준다고 합니다.
결론은 Microbiome은 MiSeq으로 대동단결(진정 MiSeq밖에 없는것인가.. Orz)
![]() |
| 출처: @sana_twice.09 |
라벨:
사나,
트와이스,
clark,
classification,
dna,
HiSeq,
KAIJU,
kraken,
metagenomic,
Microbiome,
MiSeq,
protein,
SANA,
Taxonomic,
TWICE
토요일, 9월 07, 2019
Nextera DNA Flex는 모지?
이번글은 그냥 둘러보다가 알게된
일루미나에서 새로 나온듯한 Library Kit에 대해서 한번 알아보겠습니다.
모 나온지는 1-2년된듯한 라이브러리 Kit같습니다.
일루미나 라이브러리에 TruSeq이라는 라이브러리 킷외에 Nextera라는 라이브러리 킷이 하나더 있었다는건 나 좀 시퀀싱 읆어봤다 하시는 분이라면 다 알고 계실겁니다.
Nextera가 TruSeq과의 큰 차이점이라고 한다면 fragmentation과 tagging이 Transposome이라는 짜르고 붙이는 기능이 포함되어 있는 효소를 가지고 한다는 점일 겁니다.
지금까지 제가 알고 있었던 Transposome이 라는 녀석이 하단의 fig 2. 처럼 작동해서 fragmentation의 size가 broad하다는 것으로 알고 있었는데...
![]() |
| 출처: Nextera DNA Library Prep Kits Data Sheet |
그런데 최근 Nextera Library Kit에다가 재미있는 방법을 결합시켜서 이전보다 fragmentation과 tagging 작업을 더 효율적으로 바꾼것 같아보이네요
Bead-linked Transposome 바로 BLT 되겠습니다.
Bead-linked Transposome 바로 BLT 되겠습니다.
![]() |
| 맛있겠다. 출처: 맥도널드 홈페이지 |
![]() |
| 이게진짜 BLT 출처: 일루미나 홈페이지 |
삭하고 PCR primer를 붙여버린다는...
물론 transposome의 단점은 그대로 가지고는 있다능
fragment size가 일정하지 않은데, 그리고 추가적으로 양쪽에 PCR primer가 각각 있어야되는데 그렇지 않은 애들은?
(그럼에도 불구하고 팔아먹고는 있네요.. ㅎㅎ )
그래도 이전 방법보다는 fragment size가 조금더 일정하게 나오지 않을까하는
그리고 사람 손은 한번은 덜 타니깐 조금은 나은 방법으로 발전하는게 아닌가 하고 생각은 드네요 ㅎㅎ
![]() |
| 출처: @sana_twice.09 |
관련 자료
Nextera DNA Library Prep Kit Data Sheet
Nextera Infographic
Nextera DNA Flex
Bead-linked transposomes enable a normalization-free workflow for NGS library preparation (새로나온 라이브러리 킷의 일루미나논문입니다.)
라벨:
사나,
일루미나,
트와이스,
BLT,
Illumina,
Library,
Library Prep Kit,
Nextera,
Nextera DNA Flex,
SANA,
Transposome,
TWICE
화요일, 8월 27, 2019
유전체 3사 기업 재무재표 살펴보기
음... 사실 지금까지 제 블로그에서는
허구헌날 분석 관련 로그 기록 내용이 올라 왔었는데
(그나마 그것도 잘 안올라오죠?)
그래서 이번엔 그냥 유전체 기업들 재무재표를 한번 훑어보는 기회를 가져보고자 합니다.
지금 다니고 있는 업체를 비롯해서 다녔었던 업체들 등등 동종 업체의 재무재표를
한번 훑어 보려고 하는데 전문적인 내용은 기대하지 마세요
저도 잘 알고 있는건 아니고
걍 자본과 부채의 합이 자산이라는 것만 아는 중생이라 ㅋㅋ
마크로젠, 테라젠, 디엔에이링크 3사에 의 재무정보를 통일성있게
볼 수 있도록 엑셀로 한번 만들어 봤습니다.
모 재무정보는 공시정보에 모두 공개되어있으니 대단한 정보는 아니죠 ㅎㅎ
>재무정보<
음... 짧은 지식으로 비교 하자면
마크로젠과 테라젠의 유형자산이 생각보다 차이가 많이 안납니다 테라젠의 경우 우리가 알고 있는 테라젠-이텍스 바이오연구소만 있는게 아니라 제약이 있어서 공장이 있음에도 말이죠.. 마크로젠은 왜 유형자산이 높은건지... 말하지 않겠습니다. ㅎㅎ
마크로젠은 자산치고 무형자산이 다른 두 회사보다 생각보다 적습니다.
특허가 생각보다 없다고 생각하시면되겠습니다(아놔.. 이렇게 특허압박 들어오는건가.. ).
마크로젠과 테라젠의 경우 유동부채가 꽤 큰 금액이기는 하지만 전체 부채금액 대비해서 대략 60%, 그에 비해 디엔에이링크의 경우 전체 부채대비 유동부채가 90%에 육박하고 있다는게 좀 차이점이긴 하죠
그리고 유동부채가 자산대비 좀.....
그냥 한번 유전체 3사하면 그냥 (사적으로) 생각나는 회사들의
재무재표를 한번 훑어봤습니다.
허구헌날 분석 관련 로그 기록 내용이 올라 왔었는데
(그나마 그것도 잘 안올라오죠?)
그래서 이번엔 그냥 유전체 기업들 재무재표를 한번 훑어보는 기회를 가져보고자 합니다.
지금 다니고 있는 업체를 비롯해서 다녔었던 업체들 등등 동종 업체의 재무재표를
한번 훑어 보려고 하는데 전문적인 내용은 기대하지 마세요
저도 잘 알고 있는건 아니고
걍 자본과 부채의 합이 자산이라는 것만 아는 중생이라 ㅋㅋ
마크로젠, 테라젠, 디엔에이링크 3사에 의 재무정보를 통일성있게
볼 수 있도록 엑셀로 한번 만들어 봤습니다.
모 재무정보는 공시정보에 모두 공개되어있으니 대단한 정보는 아니죠 ㅎㅎ
>재무정보<
음... 짧은 지식으로 비교 하자면
마크로젠과 테라젠의 유형자산이 생각보다 차이가 많이 안납니다 테라젠의 경우 우리가 알고 있는 테라젠-이텍스 바이오연구소만 있는게 아니라 제약이 있어서 공장이 있음에도 말이죠.. 마크로젠은 왜 유형자산이 높은건지... 말하지 않겠습니다. ㅎㅎ
마크로젠은 자산치고 무형자산이 다른 두 회사보다 생각보다 적습니다.
특허가 생각보다 없다고 생각하시면되겠습니다(아놔.. 이렇게 특허압박 들어오는건가.. ).
마크로젠과 테라젠의 경우 유동부채가 꽤 큰 금액이기는 하지만 전체 부채금액 대비해서 대략 60%, 그에 비해 디엔에이링크의 경우 전체 부채대비 유동부채가 90%에 육박하고 있다는게 좀 차이점이긴 하죠
그리고 유동부채가 자산대비 좀.....
그냥 한번 유전체 3사하면 그냥 (사적으로) 생각나는 회사들의
재무재표를 한번 훑어봤습니다.
![]() |
| 출처: @sana_twice.09 |
금요일, 4월 19, 2019
qiime2 파헤치기
간만에 qiime2도 간만에 공부하려고 docs를 한번 읽어보는 겸해서 정리도 같이? :)
그럼 qiime2가 무엇이냐 우리 롭 훃님께서 만든 microbiome분석 파이프라인,
아니 파이프라인을 뛰어넘어 토탈 분석 패키지(?)이라고 할 수 있는 툴입죠.
*토탈패키지라고까지 얘기하는 이유는 qiime1을 사용해보신 분이라면 감동의 눈물이.. ㅋ
Core Concepts는...
qiime2는 qza, qzv와 같은 독자적인 파일 형식을 지원하고 있네요
qiime1에서는 듣도보지도 못한.. 개념이라서 처음에 artifacts라는 단어를 보고
artifacts는 제거해야 제맛아니겠슴까 했는데.. ( ' ')
일단 간단히 qiime2는 qiime1과 달리 지저분하게 파일을 만들지 않고 qza, qzv 두개의 파일로 관리를 시도 하고 있습니다.
qza는 텍스트 파일을 조금더 관리가 용이하도록 json이나 table 형식으로 만든것 같고
qzv는 시각화 파일로 plot이나 그래프를 나름에 규격에 맞게 qza파일과 같이 구조화된 형식으로 만들어놓고 시각화하기 편리하도록 구현해 놓았다고 보면 될것 같습니다.
https://view.qiime2.org라는 사이트를 운영해서 qzv파일만 있으면 언제든지 확인 할 수 있도록 만든것 보면 예상 가능하죠. 어느 멍청한 놈이 만들어도 우리 사이트에 qzv파일 올리면 내용 볼수 있게 우리가 만들었어 라고 하고 있죠.
그래서 qiime2 처음 나왔을때 상용화하려고 하려나 하는 생각을 했음죠
예전에는 그냥 순수 bio업자들에게 친숙하지 않은 plain txt파일이나 csv파일만
디립다 생성하고 있는데 파일 내용을 굳이 보여주지 않지만
웹페이지에 파일 가져다 놓으면 이쁜 그림이 뙇!!
두번째로 공식적으로 plugin을 사용하여 확장성을... (이것 또한 상용화의 냄새가...)
잡았다고 얘기하고 싶겠지만... 일단 제가 qiime2를 한번도 안써봐서
모 내머리에서 번뜩 생각나는 것들인 이미 plugin으로 만들어놨을듯한..
어차피 루틴하게 쓸만한 plugin은 이미 다 있을테니 가져다가 사용하면 될듯 합니다.
plugin개발하고 싶으시면 >> 여기로 (전 너님이 개발하면 유용하게 쓰겠습니다. ㅎㅎ )
모 처음으로 qiime2 첫 페이지를 읽어 보았습니다.
다음에는 install qiime2를 해보고 싶은데..
사용할수 있는 서버가 닫혀있어서...
테스트를 해볼 수가 없네요 ㅎㅎ :)
여튼 사적으로 접근 가능한 서버가 열리면 한번 테스트해서 자세한 리뷰한번 해보는걸로 :)
ps. 이제 고대 유물이 된 qiime1 base로 만든 파이프라인은 어디에 팔아먹나...
그럼 qiime2가 무엇이냐 우리 롭 훃님께서 만든 microbiome분석 파이프라인,
아니 파이프라인을 뛰어넘어 토탈 분석 패키지(?)이라고 할 수 있는 툴입죠.
*토탈패키지라고까지 얘기하는 이유는 qiime1을 사용해보신 분이라면 감동의 눈물이.. ㅋ
Core Concepts는...
qiime2는 qza, qzv와 같은 독자적인 파일 형식을 지원하고 있네요
qiime1에서는 듣도보지도 못한.. 개념이라서 처음에 artifacts라는 단어를 보고
artifacts는 제거해야 제맛아니겠슴까 했는데.. ( ' ')
일단 간단히 qiime2는 qiime1과 달리 지저분하게 파일을 만들지 않고 qza, qzv 두개의 파일로 관리를 시도 하고 있습니다.
qza는 텍스트 파일을 조금더 관리가 용이하도록 json이나 table 형식으로 만든것 같고
qzv는 시각화 파일로 plot이나 그래프를 나름에 규격에 맞게 qza파일과 같이 구조화된 형식으로 만들어놓고 시각화하기 편리하도록 구현해 놓았다고 보면 될것 같습니다.
https://view.qiime2.org라는 사이트를 운영해서 qzv파일만 있으면 언제든지 확인 할 수 있도록 만든것 보면 예상 가능하죠. 어느 멍청한 놈이 만들어도 우리 사이트에 qzv파일 올리면 내용 볼수 있게 우리가 만들었어 라고 하고 있죠.
그래서 qiime2 처음 나왔을때 상용화하려고 하려나 하는 생각을 했음죠
예전에는 그냥 순수 bio업자들에게 친숙하지 않은 plain txt파일이나 csv파일만
디립다 생성하고 있는데 파일 내용을 굳이 보여주지 않지만
웹페이지에 파일 가져다 놓으면 이쁜 그림이 뙇!!
두번째로 공식적으로 plugin을 사용하여 확장성을... (이것 또한 상용화의 냄새가...)
잡았다고 얘기하고 싶겠지만... 일단 제가 qiime2를 한번도 안써봐서
모 내머리에서 번뜩 생각나는 것들인 이미 plugin으로 만들어놨을듯한..
어차피 루틴하게 쓸만한 plugin은 이미 다 있을테니 가져다가 사용하면 될듯 합니다.
plugin개발하고 싶으시면 >> 여기로 (전 너님이 개발하면 유용하게 쓰겠습니다. ㅎㅎ )
모 처음으로 qiime2 첫 페이지를 읽어 보았습니다.
다음에는 install qiime2를 해보고 싶은데..
사용할수 있는 서버가 닫혀있어서...
테스트를 해볼 수가 없네요 ㅎㅎ :)
여튼 사적으로 접근 가능한 서버가 열리면 한번 테스트해서 자세한 리뷰한번 해보는걸로 :)
ps. 이제 고대 유물이 된 qiime1 base로 만든 파이프라인은 어디에 팔아먹나...
![]() |
| 출처: SM |
금요일, 3월 15, 2019
간만에 de novo RNA-Seq 해보기 -조립편-
Trinity를 사용한 de novo RNA-seq은 별거없습니다.
다음과 같은 명령어를 사용하면 끝!
기본 Assembly 방법:
Genome Guide Assembly 방법:
유경험자면 아시겠지만 RNA-Seq 데이터만 있으면 걍 default assembly방법을 사용하시는게 제일 좋은 결과를 얻으실 수 있으실겁니다.
어설프지만 genome 데이터가 있는데 그냥 하는것 보다 어설프더라도 genome을 활용하는게 좋지 않을까? 응 하지 마세요
어설픈 input은 어설픈 output을 너님의 손에 가져다 줍니다.
하실꺼면 Reference Genome 만드실때 genome을 탄탄하게 만들고 다양한 단계의 RNA-Seq을 하셔서 gene prediction할 때 RNA-Seq 데이터를 활용하세요
그게 맞는 방법입니다. :)
그리고 --SS_lib_type에 어떤 걸 넣어야 할지 난 모르겠다 하시는분은 여기 biostars를 참고하세요 :)
좀 더 자세한 wiki >여기<
다음과 같은 명령어를 사용하면 끝!
기본 Assembly 방법:
$ ~/trinityrnaseq-Trinity-v2.6.6/Trinity --seqType fq --max_memory <memory_size> --samples_file <sample.txt> --SS_lib_type <library type> --CPU <thread_num> --full_cleanup
$ ~/trinityrnaseq-Trinity-v2.6.6/Trinity --seqType fq --max_memory <memory_size> --left <left.fq.gz> --right <right.fq.gz> --SS_lib_type <library type> --CPU <thread_num> --full_cleanup
Genome Guide Assembly 방법:
$ ~/trinityrnaseq-Trinity-v2.6.6/Trinity --seqType fq --max_memory <memory_size> --samples_file <sample.txt> --SS_lib_type <library type> --CPU <thread_num> --genome_guided_bam <align.bam> --genome_guided_max_intron <max_intron> --full_cleanup
유경험자면 아시겠지만 RNA-Seq 데이터만 있으면 걍 default assembly방법을 사용하시는게 제일 좋은 결과를 얻으실 수 있으실겁니다.
어설프지만 genome 데이터가 있는데 그냥 하는것 보다 어설프더라도 genome을 활용하는게 좋지 않을까? 응 하지 마세요
어설픈 input은 어설픈 output을 너님의 손에 가져다 줍니다.
하실꺼면 Reference Genome 만드실때 genome을 탄탄하게 만들고 다양한 단계의 RNA-Seq을 하셔서 gene prediction할 때 RNA-Seq 데이터를 활용하세요
그게 맞는 방법입니다. :)
그리고 --SS_lib_type에 어떤 걸 넣어야 할지 난 모르겠다 하시는분은 여기 biostars를 참고하세요 :)
좀 더 자세한 wiki >여기<
![]() |
| 출처: JYP |
라벨:
사나,
삼위일체,
트와이스,
de novo RNAseq,
Trinity
일요일, 3월 10, 2019
간만에 denovo RNA-Seq 해보기 -설치편-
최근 간만에 해보기가 올라가고 있는데...
진짜 2년만에 RNA-seq 분석을 해봐서..
걍 분석하는 단계나 프로그램 사용법 정리 차원에서 글을 올리고 있습니다.
4짜 산업 시대에 발맞춰 유전체 데이터 전문 설거지팀 하나 꾸리는것도 나쁘지 않을듯.... (대신 건당 비용때문에 수주가 안들어올 것 같다는게 함정 ㅎㅎ )
여튼 오늘은 de novo RNA-Seq 분석입니다.
일단 de novo RNAseq 시장을 석권했던.. 지금도 지배하고 있는 것으로 보이는데..
제가 사용했던 버전은 2.0.6이었는데.. ㄷㄷㄷ 벌써 2.8.4네요..
다들 아시는 삼위일체 Trinity 입니다.
지금 사용하는 서버에서는 cmake버전이 2.x라서 2.8.4대신 낮은 버전인 2.6.6버전으로 테스트를 수행하고 있습니다.
같은 input에 옵션이 비슷한데 2.6과 2.8의 결과가 많이 달라질지는 잘 모르겠습니다.
버전별 output 비교는 나중에 한번 기회되면 도전해보는것으로!!
참고로 make했을때 어쩌구 저쩌구 /usr/local/bin 권한없다라는 메세지를 보여주고 에러를 밷어낸다면 trinityrnaseq-Trinity-v2.6.6/util/support_scripts/ 밑에 있는 trinity_installer.py 파일의 destination_package_dir 변수명의 내용을 수정해주시면됩니다.
(제 경우 make할때 DESTDIR 설정을 해주어도 계속 /usr/local/bin을 요구해서... trinity_install.py 파일을 직접 수정했습니다. ㅎㅎ 다른 방법이 분명 있을거 같은데.. )
여튼 에러가 발생한다면 해당 에러를 잡고 설치하면(당연한 소리를..) 문제 없을것이라고 말씀드릴 수 있습니다!!
진짜 2년만에 RNA-seq 분석을 해봐서..
걍 분석하는 단계나 프로그램 사용법 정리 차원에서 글을 올리고 있습니다.
4짜 산업 시대에 발맞춰 유전체 데이터 전문 설거지팀 하나 꾸리는것도 나쁘지 않을듯.... (대신 건당 비용때문에 수주가 안들어올 것 같다는게 함정 ㅎㅎ )
여튼 오늘은 de novo RNA-Seq 분석입니다.
일단 de novo RNAseq 시장을 석권했던.. 지금도 지배하고 있는 것으로 보이는데..
제가 사용했던 버전은 2.0.6이었는데.. ㄷㄷㄷ 벌써 2.8.4네요..
다들 아시는 삼위일체 Trinity 입니다.
지금 사용하는 서버에서는 cmake버전이 2.x라서 2.8.4대신 낮은 버전인 2.6.6버전으로 테스트를 수행하고 있습니다.
같은 input에 옵션이 비슷한데 2.6과 2.8의 결과가 많이 달라질지는 잘 모르겠습니다.
버전별 output 비교는 나중에 한번 기회되면 도전해보는것으로!!
$ wget https://github.com/trinityrnaseq/trinityrnaseq/archive/Trinity-v2.6.6.tar.gz
$ tar zxf Trinity-v2.6.6.tar.gz
$ cd trinityrnaseq-Trinity-v2.6.6/
$ make && make install
참고로 make했을때 어쩌구 저쩌구 /usr/local/bin 권한없다라는 메세지를 보여주고 에러를 밷어낸다면 trinityrnaseq-Trinity-v2.6.6/util/support_scripts/ 밑에 있는 trinity_installer.py 파일의 destination_package_dir 변수명의 내용을 수정해주시면됩니다.
(제 경우 make할때 DESTDIR 설정을 해주어도 계속 /usr/local/bin을 요구해서... trinity_install.py 파일을 직접 수정했습니다. ㅎㅎ 다른 방법이 분명 있을거 같은데.. )
여튼 에러가 발생한다면 해당 에러를 잡고 설치하면(당연한 소리를..) 문제 없을것이라고 말씀드릴 수 있습니다!!
![]() |
| 출처: SM |
피드 구독하기:
글 (Atom)














