---
#### 1. **`nFeature_RNA`**
- 정의* : 한 세포에서 검출된 **고유 유전자(gene) 개수**.
- 생물학적 해석*
|상황|가능한 생물학적/기술적 원인|흔한 조치|
|---|---|---|
|**매우 낮음** (예: < 200 genes)|• 세포가 파괴·용해되어 세포질 RNA 손실 <br>• 라이브러리 구축 실패 / 세포 내용물 희석(ambient RNA)|저품질 세포 제거|
|**정상 범위** (예: 200 – 2 500 genes, 조직·플랫폼에 따라 다름)|• 생존한 단일 세포|유지|
|**매우 높음** (예: > 2 500 – 3 000 genes)|• **더블릿/멀티플릿**(두 개 이상 세포 동시 캡처) <br>• 거대세포(예: 대식세포, 종양세포)의 과도한 전사량|더블릿 필터링 또는 후속 검토|
#### 2. **`nCount_RNA`**
- 정의* : 한 세포에서 수집된 **전체 UMI(또는 read) 수** — “라이브러리 크기”.
- 생물학적 해석*
| 상황 | 가능한 생물학적/기술적 원인 | 흔한 조치 |
| --------- | --------------------------------------------------------- | ------------------- |
| **낮음** | • 세포 파괴·부분 용해 <br>• 역전사/증폭 비효율 <br>• 작은 세포(적은 mRNA 함량) | 저품질 세포 제거 |
| **정상 범위** | • 건강한 단일 세포 | 유지 |
| **높음** | • 더블릿/멀티플릿 <br>• 매우 활성화된 세포(예: 세포주, 종양세포) <br>• rRNA 오염 | 더블릿 탐지·제거, 정규화 시 주의 |
#### 3. **`percent.mt`**
- 정의* : 한 세포에서 **미토콘드리아 유전자(‘^MT-’ 패턴)**가 차지하는 UMI 비율.
- 생물학적 해석*
|비율|의미|흔한 임계값|
|---|---|---|
|**↓ (0 – 5 %)**|• 정상적 호흡·대사 상태의 세포|유지|
|**중간(5 – 10 %)**|• 경미한 스트레스·부분 손상 가능성|조직·실험 목적에 따라 필터링 여부 결정|
|**↑ (> 10 – 20 %)**|• **세포막 손상** → 세포질 mRNA 유실, 미토콘드리아 mRNA 상대적 증가 <br>• 아포토시스·산화 스트레스 활성화|고비율 세포 제거 권장|
미토콘드리아 전사체는 세포질보다 구조적으로 보호받아 파괴된 세포에서 상대적으로 풍부하게 남습니다. 따라서 `percent.mt`는 **“세포 건강도”**를 뜻하는 경험적 지표로 널리 사용됩니다.
아래에 **ribosomal gene**과 **mt gene** 관련 QC 지표를 추가했습니다. 기존 구조를 그대로 따라가되, 4번과 5번 항목을 보시면 됩니다.
#### 4. **`nFeature_MT`**
- 정의* : 한 세포에서 검출된 **미토콘드리아 유전자 개수** (`MT-` 접두어를 가진 유전자 수).
- 생물학적 해석*
|개수|의미|흔한 조치|
|---|---|---|
|**매우 낮음** (예: < 3 genes)|• 시퀀싱 깊이 부족 또는 MT 유전자 어노테이션 누락• 라이브러리 준비 오류|· MT 유전자 어노테이션 확인· 저품질 세포 제거|
|**정상 범위** (예: 3 – 20 genes, 플랫폼별 차이)|• 정상적 미토콘드리아 전사|· 유지|
|**높음** (예: > 20 genes)|• 세포 파괴 시 MT 전사체만 일부 남음• 높은 스트레스/아포토시스 활성화|· `percent.mt`와 함께 고비율 세포 제거|
> _Tip:_ `nFeature_MT`는 `percent.mt` 가 높게 나왔을 때, 실제 MT 유전자 종류가 몇 개 검출됐는지 확인하는 보조 지표로 유용합니다.
#### 5. **`percent.ribo`**
- 정의* : 한 세포에서 **ribosomal protein 유전자** (보통 `RPS*`, `RPL*` 패턴)의 UMI 비율.
- 생물학적 해석*
| 비율 | 의미 | 흔한 임계값 |
| ----------------- | ----------------------------------------------------------- | -------------------------------- |
| **낮음** (< 5 %) | • 낮은 번역활성 또는 세포 휴지기 상태 | · 유지 |
| **중간** (5 – 20 %) | • 정상적 단백질 합성 활동 | · 유지 |
| **높음** (> 20 %) | • 과도한 번역활성 (예: rapidly dividing cells)• rRNA 오염 또는 핵 RNA 잔류 | · 오염 의심 시 라이브러리 준비 확인· 극단치 제거 검토 |
> **왜 중요한가?**
> Ribosomal gene 발현 비율은 세포의 **번역(translation) 활성도**를 반영합니다. 특정 세포주나 활성화된 면역세포에서는 기본적으로 높을 수 있지만, 전체 세포군 중 유난히 높게 튀는 셀은 기술적 오염(예: rRNA 분해산물) 가능성을 시사합니다.
---
아래에서는 **미토콘드리아 유전자(mt‑gene)**와 **리보솜 유전자(ribo‑gene)**가 갖는 생물학적 의미부터, single‑cell QC 단계에서 이들을 왜 그리고 어떻게 살펴봐야 하는지, 구체적인 분석 방법까지 자세히 정리했습니다.
---
## 1. 미토콘드리아 유전자 (mt‑gene)
### 1.1. 생물학적 배경
- **기능**: 미토콘드리아는 세포 호흡 및 에너지(ATP) 생산의 핵심 기관으로, 자체적으로 약 13개의 단백질 코딩 유전자(mt‑mRNA)와 다수의 tRNA, rRNA 유전자를 보유합니다.
- **구조적 특징**: 세포질에 비해 상대적으로 이중막 안에 보호되어 있어, 세포가 손상되거나 붕괴될 때 미토콘드리아 내 RNA가 세포질 RNA보다 더 온전하게 남는 경향이 있습니다.
### 1.2. QC 지표로서의 의미
- **percent.mt**: 전체 UMI(read) 중 `MT-`로 시작하는 유전자가 차지하는 비율.
- **높을 때**:
- **세포막 손상** → 세포질 mRNA 손실
- **아포토시스/산화스트레스** → 미토콘드리아 전사체 상대적 증가
- **낮을 때**: 정상 세포 상태
- **nFeature_MT**: 검출된 mt‑gene 종류 수.
- **좁은 스펙트럼(예: 1–2종류)**: 라이브러리·시퀀싱 오류 가능
- **너무 많은 종류(예: >20종류)**: 심각한 세포 파괴
### 1.3. 분석 시나리오 및 방법
|상황|분석·조치 방법|
|---|---|
|`percent.mt` 급증 (예: >15%)|1. **Scatter plot**: `percent.mt` vs `nCount_RNA` 로 손상 세포 구분2. **Thresholding**: 일반 조직은 보통 5–10% 컷오프, 스트레스 조직은 최대 15–20%까지 허용3. **필터링**: `adata = adata[adata.obs['percent_mt'] < 0.15]` (Scanpy 예시)|
|mt‑gene 종류가 너무 적거나 많음|1. **바이올린 플롯**: `nFeature_MT` 분포 확인2. **기술적 오류 점검**: FASTQ QC(예: FastQC)에서 mt‑read 비율 확인 및 어노테이션 누락 여부 점검|
|조직·세포 유형별 정상 범위가 다른 경우|각 샘플별 **violin plot** 또는 **box plot**으로 그룹별 분포 비교 후, 적절한 필터링 컷오프 설정|
```python
# Scanpy 예시
import scanpy as sc
# 1) mt‐gene 비율 계산
adata.obs['percent_mt'] = (
adata[:, adata.var_names.str.startswith('MT-')].X.sum(axis=1)
/ adata.X.sum(axis=1)
) * 100
# 2) 시각화
sc.pl.scatter(adata, x='nCount_RNA', y='percent_mt')
sc.pl.violin(adata, keys='percent_mt', groupby='batch', stripplot=False)
# 3) 필터링
adata = adata[adata.obs['percent_mt'] < 15, :]
```
---
## 2. 리보솜 유전자 (ribo‑gene)
### 2.1. 생물학적 배경
- **기능**: 리보솜은 단백질 합성의 ‘공장’ 역할을 하는 거대 복합체로, `RPS*` (small subunit) 및 `RPL*` (large subunit) 유전자가 주성분입니다.
- **표현 패턴**: 세포 증식률이나 활성화 상태에 따라 발현 수준이 크게 변동합니다. 예를 들어, 빠르게 분열하는 세포주나 활성화된 면역세포는 ribo‑gene 비율이 높습니다.
### 2.2. QC 지표로서의 의미
- **percent.ribo**: 전체 UMI 중 `RPS*`/`RPL*`로 시작하는 유전자의 비율.
- **낮음 (<5%)**: 낮은 번역활성 또는 휴지기 상태
- **정상 (5–20%)**: 건강한 단백질 합성
- **과도 (>20%)**:
- 과도한 번역활성(rapidly dividing)
- **rRNA 오염** 또는 핵 RNA 파편 잔류 가능성
### 2.3. 분석 시나리오 및 방법
|상황|분석·조치 방법|
|---|---|
|`percent.ribo` 극단적 상위 셀|1. **Scatter plot**: `percent.ribo` vs `nCount_RNA`2. **Histogram**: 전반적 분포 확인 후 이상치 컷오프 (예: 상위 1–2%)3. **라이브러리 준비 점검**: rRNA 제거 효율 확인|
|세포 유형별 정상 범위가 다른 경우|세포 타입(클러스터)별로 **violin plot** 그려서 클러스터별 분포 비교 후, 클러스터별 컷오프 설정|
|ribo‑gene 과다 오염 의심|1. FASTQ 레벨에서 rRNA 컨탐 확인 (e.g., SortMeRNA)2. 필요 시 **rRNA 제거 키트** 재검토 또는 시퀀싱 파이프라인 수정|
```python
# percent.ribo 계산 예시 (Scanpy)
ribo_genes = adata.var_names.str.startswith(tuple(['RPS', 'RPL']))
adata.obs['percent_ribo'] = (
adata[:, ribo_genes].X.sum(axis=1)
/ adata.X.sum(axis=1)
) * 100
# 시각화 및 필터링
sc.pl.scatter(adata, x='nCount_RNA', y='percent_ribo')
adata = adata[adata.obs['percent_ribo'] < 20, :]
```
---
## 3. 종합적 QC 파이프라인 적용 팁
1. **순차적 필터링**
- (1) `nFeature_RNA` → (2) `nCount_RNA` → (3) `percent.mt` → (4) `nFeature_MT` → (5) `percent.ribo`
- 각 단계마다 필터링 전후 셀 수 변화를 모니터링
2. **시각화 기반 컷오프 결정**
- Scatter, Violin, Histogram 등을 활용해 데이터 분포를 보고, 조직·샘플별로 최적화된 임계값 설정
3. **샘플·클러스터별 커스터마이징**
- 서로 다른 조직·세포 유형은 QC 지표 정상 범위가 다름. 배치(batch)나 클러스터별로 별도 컷오프 적용
4. **바깥환경(ambient RNA) 보정**
- SoupX, DecontX 등의 도구로 ambient RNA 오염 교정 후, mt·ribo 지표 재계산
---
위와 같은 절차를 통해 **미토콘드리아 유전자**와 **리보솜 유전자**를 QC 지표로 적극 활용하여, single‑cell 데이터의 기술적 노이즈를 최소화하고 생물학적 해석의 정확도를 높일 수 있습니다.