Deep-tech consulting&integrated systems architecture.

RESEARCH

AAPR

Absolute-Address Partial Residency. Dense Transformer 내부에서 반복되는 조건부 실행 관계를 주소 기반의 재사용 가능한 정보로 만드는 추론 실행 구조입니다.

실행 관계 자체를 재사용 가능한 정보로 봅니다

AAPR의 출발점은 activation sparsity 자체가 아닙니다. 현재 post-hoc 형태에서는 이전 activation address가 고정된 조건부 전이 지도의 key가 되고, 그 관계가 다음 execution address set을 반환합니다. 압축하면 '이전 활성 주소 → 고정된 조건부 전이 관계 → 다음 실행 주소'의 구조입니다.

선택적 계산은 결과입니다

AAPR은 별도의 learned sparse predictor로 미래 activation을 먼저 예측해 sparsity를 만드는 방식이 아니며, 모든 입력에 하나의 global static mask를 적용하는 방식도 아닙니다. 기록된 execution relation이 다음 계산 위치를 직접 지시하기 때문에 그 결과로 선택적 계산과 부분 상주가 발생합니다.

측정된 PoC

현재 PoC는 Gemma 3 4B NF4 4-bit의 MLP down_proj를 대상으로 합니다. 레이어당 2,560개 출력 채널 중 80개, 즉 3.125%를 선택해 L0–12의 13-layer 연쇄 구간을 검증했습니다. Steps 40–41의 검증 범위에서는 기록된 transition map과 실시간 oracle 사이의 observed top-1 gap이 0이었습니다.

실제 부분 계산과 부분 상주

Step 42에서는 선택된 row만 GPU로 전송해 실제 partial multiplication을 수행했으며, 전송량은 token당 19.2 MB로 대응되는 13-layer 전체 row 전송량의 약 2.8%였습니다. Step 43에서는 일부 original down_proj payload를 GPU 메모리에서 실제로 제거했고, 측정 VRAM은 3,418 MB에서 3,260 MB로 157 MB 감소했으며 검증 대상 답변은 유지되었습니다.

이 수치는 현재 down_proj PoC에서 직접 측정한 결과이며, 전체 모델 연산량이 96.875% 감소했다는 뜻은 아닙니다.

논리적 존재와 물리적 상주를 분리합니다

AAPR은 전체 logical address space가 존재하는 것과 모든 payload가 동시에 고속 메모리에 상주하는 것을 별개의 조건으로 다룹니다. 필요한 weight payload만 현재 실행 주소에 따라 materialize하거나 resident하게 둘 수 있으며, 기존 Dense Transformer의 matrix-multiplication primitive 자체는 유지합니다.