**TCGA**는 **The Cancer Genome Atlas**의 약자로, 암 유전체 아틀라스 프로젝트예요.
미국 국립암연구소(NCI)와 국립인간게놈연구소(NHGRI)가 2006년부터 공동으로 진행한 대규모 암 유전체 연구 프로그램입니다.
주요 목표는 **인간 암의 분자적 기전을 이해**하기 위해 주요 암종들의 종양과 정상 조직을 대규모로 분석해서 유전체·전사체·에피게놈·단백질체 등의 다차원 데이터를 만드는 것이었어요.
### TCGA의 주요 규모와 내용 (2025~2026 기준 최신 정보)
- 분석한 암종 수 : **33개** (유방암, 폐암, 대장암, 간암, 위암, 췌장암, 뇌종양 등 흔한 암부터 희귀암까지 포함)
- 샘플 수 : 약 **20,000개** 이상의 원발성 종양 + 대응 정상 조직 쌍
- 생성된 데이터 양 : **2.5 페타바이트(PB)** 이상
- 데이터 종류
- WGS / WES (전장/엑솜시퀀싱)
- RNA-Seq (mRNA 발현)
- miRNA-Seq
- DNA 메틸화 (450K / EPIC array 등)
- Copy Number Variation (CNV)
- 단백질 발현 (RPPA)
- 임상 정보 (생존, stage, 치료 반응 등)
이 데이터는 대부분 **공개**되어 있어서 전 세계 연구자들이 자유롭게 다운로드해서 사용할 수 있습니다. (일부 raw sequencing read는 dbGaP controlled access 필요)
### 연구에서 TCGA 데이터를 주로 어떻게 사용하는가? (실제 활용 순서)
1. **데이터 접근 & 다운로드 방법** (가장 흔한 3가지 경로)
| 방법 | 난이도 | 추천 대상 | 주요 링크 |
|-------------------|--------|------------------------------------|----------------------------------------|
| GDC Data Portal | ★★☆ | 초중급~고급, 원본 데이터 필요 시 | https://portal.gdc.cancer.gov/ |
| cBioPortal | ★☆☆ | 대부분의 사람 (가장 편함) | https://www.cbioportal.org/ |
| TCGAbiolinks (R) | ★★★ | R 사용자, 대량·맞춤 분석 시 | Bioconductor 패키지 |
요즘은 **cBioPortal**이나 **UCSC Xena**를 가장 많이 씁니다. (브라우저에서 바로 heatmap, survival plot, mutation oncoprint 등을 그릴 수 있어요)
2. **주요 연구 목적 & 실제 사용 예시**
| 연구 목적 | 대표적인 분석 방법 | 흔히 나오는 논문 유형 |
|----------------------------------|--------------------------------------------------|--------------------------------------------|
| 종양 vs 정상 발현 차이 | DESeq2 / edgeR로 differential expression | 새로운 바이오마커 발굴 |
| 예후 바이오마커 스크리닝 | Kaplan-Meier + log-rank, Cox regression | "XX 유전자는 XX 암에서 불량 예후 인자" |
| driver mutation / pathway 분석 | MutSigCV, GSEA, pathway enrichment | 특정 암종의 핵심 driver gene 규명 |
| 면역 관련 분석 | CIBERSORT, ESTIMATE, immune signature score | 면역치료 반응 예측 인자 |
| subtype 재분류 / pan-cancer 분석 | NMF, consensus clustering, iCluster | 새로운 분자 아형 발견 |
| multi-omics 통합 분석 | iClusterPlus, MOFA+, NEMO | 유전체+전사체+메틸화 통합 signature |
3. **초보자가 가장 빨리 시작하는 현실적인 workflow 예시** (2025~2026 기준)
4. cBioPortal → https://www.cbioportal.org/ 접속
5. TCGA Pan-cancer Atlas 2018 또는 TCGA 해당 암종 선택
6. 원하는 유전자 입력 → oncoprint, survival, expression boxplot, co-expression 등 자동 시각화
7. 흥미로운 결과 발견 → "Results" → "Download Data"로 .tsv 파일 다운
8. R이나 Python으로 후속 분석 (예: survival 패키지로 Cox 모델, ggplot2로 그리기)
또는 R에서 바로 하고 싶다면:
```R
# 가장 쉬운 시작 방법
if (!require(TCGAbiolinks)) BiocManager::install("TCGAbiolinks")
library(TCGAbiolinks)
# 예: BRCA (유방암) RNA-seq 데이터 불러오기
query <- GDCquery(project = "TCGA-BRCA",
data.category = "Transcriptome Profiling",
data.type = "Gene Expression Quantification",
workflow.type = "STAR - Counts")
GDCdownload(query)
data <- GDCprepare(query)
```
요즘 대학원생·연구원들은 대부분 위 방법 중 1~2가지만 골라서 씁니다.
---