scRNA-seq 데이터는 낮은 capture efficiency로 인해 유효한 read가 충분히 반영되지 못하는 데이터 부족(data sparsity)의 문제가 발생하는 경우가 많습니다.
이로 인해 cell type annotation의 정확도가 낮아지는 문제를 초래할 수 있습니다.
테라젠바이오는 이를 개선하기 위해 Optimized Transcriptome Reference Alignment (Human, Mouse)를 적용하여 데이터 활용도를 극대화합니다.
False intergenic 리드를 복구하고, 하이브리드 pre-mRNA 맵핑을 수행하며, 유전자 중첩 문제를 효과적으로 완화함으로써, 기존 분석 대비 더 많은 유효 read를 반영하고 데이터 부족 문제와 gene detection sensitivity를 향상시킵니다.
이를 통해 downstream 분석에서 보다 안정적인 결과 해석이 가능합니다.
2️⃣ 머신러닝 기반 Cell QC (Dropkick)
분석자 편차를 최소화한 일관된 QC 수행
▲ 그림2. Dropkick의 cell QC 및 분류 과정
Cell QC는 기술적 노이즈를 제거하고 신뢰도 높은 데이터를 확보하기 위한 필수 단계입니다.
다만, 기존의 threshold 기반 QC는 분석자의 주관이 개입될 가능성이 높고, 샘플 특성에 따라 기준 설정이 달라질 수 있으며, 여러 샘플에 일관된 기준을 적용하기 어렵다는 한계가 있습니다.
테라젠바이오는 이러한 문제를 보완하기 위해
Dropkick 기반 머신러닝 QC 방법을 적용하고 있습니다.
수동 threshold 설정 없이 자동으로 QC 기준 도출
세포와 empty droplet을 모델 기반으로 구분
cross-validation 기반 regularization을 통해 → 과적합을 방지하고 안정적인 성능 유지
다양한 조건의 샘플에서도 → 일관된 QC 기준 적용 가능
이를 통해 분석자의 주관 개입을 줄이면서도 재현성과 신뢰도를 확보한 QC 결과를 제공합니다.
3️⃣ GPTCelltype
비모델 생물종에서도 적용 가능한 Cell Type Annotation
▲ 그림3. GPT-4와 다른 Tool과의 성능비교
Cell type annotation은 scRNA-seq 데이터 해석의 핵심 단계이며, 특히 non-model organism에서는 마커 정보의 제한으로 인해 정확도가 낮아질 수 있습니다.
테라젠바이오는 기존 DB (Human: Sctype DB, Mouse: Panglao DB) 기반의 marker scoring annotation을 제공함과 동시에, GPT-4 기반 GPTCelltype을 활용한 보완적 annotation 전략을 적용하고 있습니다.
마커 유전자 리스트 기반으로 다양한 종에서 cell type 예측 가능
기존 annotation DB 대비 변별력이 향상된 cell type annotation 결과 도출
reference 정보가 제한적인 샘플에서도 적용 가능
특히 특정 조직이나 연구가 제한적인 조건에서는 기존 방법 대비 보다 안정적인 annotation 결과를 제공할 수 있습니다. (그림3)
테라젠바이오의 scRNA-seq 서비스는 단순한 데이터 처리에 그치지 않고, 데이터 손실 최소화, QC 자동화, 정밀한 annotation까지 분석 전 단계를 고도화하여 더 신뢰도 높은 결과를 제공합니다.
보다 정확하고 일관된 scRNA-seq 분석이 필요하시다면,
테라젠바이오의 scRNA-seq 서비스를 경험해보세요!
single cell RNA sequencing 관련 테라노트는 아래 링크를 참고해주세요.