**TCGA**는 **The Cancer Genome Atlas**의 약자로, 암 유전체 아틀라스 프로젝트예요. 미국 국립암연구소(NCI)와 국립인간게놈연구소(NHGRI)가 2006년부터 공동으로 진행한 대규모 암 유전체 연구 프로그램입니다. 주요 목표는 **인간 암의 분자적 기전을 이해**하기 위해 주요 암종들의 종양과 정상 조직을 대규모로 분석해서 유전체·전사체·에피게놈·단백질체 등의 다차원 데이터를 만드는 것이었어요. ### TCGA의 주요 규모와 내용 (2025~2026 기준 최신 정보) - 분석한 암종 수 : **33개** (유방암, 폐암, 대장암, 간암, 위암, 췌장암, 뇌종양 등 흔한 암부터 희귀암까지 포함) - 샘플 수 : 약 **20,000개** 이상의 원발성 종양 + 대응 정상 조직 쌍 - 생성된 데이터 양 : **2.5 페타바이트(PB)** 이상 - 데이터 종류 - WGS / WES (전장/엑솜시퀀싱) - RNA-Seq (mRNA 발현) - miRNA-Seq - DNA 메틸화 (450K / EPIC array 등) - Copy Number Variation (CNV) - 단백질 발현 (RPPA) - 임상 정보 (생존, stage, 치료 반응 등) 이 데이터는 대부분 **공개**되어 있어서 전 세계 연구자들이 자유롭게 다운로드해서 사용할 수 있습니다. (일부 raw sequencing read는 dbGaP controlled access 필요) ### 연구에서 TCGA 데이터를 주로 어떻게 사용하는가? (실제 활용 순서) 1. **데이터 접근 & 다운로드 방법** (가장 흔한 3가지 경로) | 방법 | 난이도 | 추천 대상 | 주요 링크 | |-------------------|--------|------------------------------------|----------------------------------------| | GDC Data Portal | ★★☆ | 초중급~고급, 원본 데이터 필요 시 | https://portal.gdc.cancer.gov/ | | cBioPortal | ★☆☆ | 대부분의 사람 (가장 편함) | https://www.cbioportal.org/ | | TCGAbiolinks (R) | ★★★ | R 사용자, 대량·맞춤 분석 시 | Bioconductor 패키지 | 요즘은 **cBioPortal**이나 **UCSC Xena**를 가장 많이 씁니다. (브라우저에서 바로 heatmap, survival plot, mutation oncoprint 등을 그릴 수 있어요) 2. **주요 연구 목적 & 실제 사용 예시** | 연구 목적 | 대표적인 분석 방법 | 흔히 나오는 논문 유형 | |----------------------------------|--------------------------------------------------|--------------------------------------------| | 종양 vs 정상 발현 차이 | DESeq2 / edgeR로 differential expression | 새로운 바이오마커 발굴 | | 예후 바이오마커 스크리닝 | Kaplan-Meier + log-rank, Cox regression | "XX 유전자는 XX 암에서 불량 예후 인자" | | driver mutation / pathway 분석 | MutSigCV, GSEA, pathway enrichment | 특정 암종의 핵심 driver gene 규명 | | 면역 관련 분석 | CIBERSORT, ESTIMATE, immune signature score | 면역치료 반응 예측 인자 | | subtype 재분류 / pan-cancer 분석 | NMF, consensus clustering, iCluster | 새로운 분자 아형 발견 | | multi-omics 통합 분석 | iClusterPlus, MOFA+, NEMO | 유전체+전사체+메틸화 통합 signature | 3. **초보자가 가장 빨리 시작하는 현실적인 workflow 예시** (2025~2026 기준) 4. cBioPortal → https://www.cbioportal.org/ 접속 5. TCGA Pan-cancer Atlas 2018 또는 TCGA 해당 암종 선택 6. 원하는 유전자 입력 → oncoprint, survival, expression boxplot, co-expression 등 자동 시각화 7. 흥미로운 결과 발견 → "Results" → "Download Data"로 .tsv 파일 다운 8. R이나 Python으로 후속 분석 (예: survival 패키지로 Cox 모델, ggplot2로 그리기) 또는 R에서 바로 하고 싶다면: ```R # 가장 쉬운 시작 방법 if (!require(TCGAbiolinks)) BiocManager::install("TCGAbiolinks") library(TCGAbiolinks) # 예: BRCA (유방암) RNA-seq 데이터 불러오기 query <- GDCquery(project = "TCGA-BRCA", data.category = "Transcriptome Profiling", data.type = "Gene Expression Quantification", workflow.type = "STAR - Counts") GDCdownload(query) data <- GDCprepare(query) ``` 요즘 대학원생·연구원들은 대부분 위 방법 중 1~2가지만 골라서 씁니다. ---