늘모자란, 개발 :: 0.07%는 가속이라고 부르기 어려웠다

늘모자란, 개발

로컬 270억 매개변수 판단 모델의 432토큰 입력에서 컴파일 실행은 일반 실행보다 0.004초 빨랐다. 6.759초가 6.755초로 줄어든 것이다. 비율로는 0.07%라서, 이 결과를 실용적인 가속이라고 부르기는 어렵다.

측정은 같은 두 입력으로 일반 실행과 컴파일 실행을 번갈아 16회 진행했다. 입력 형태마다 첫 실행에는 준비 비용이 섞이므로 비교에서 제외했다. 나머지 실행은 모델을 메모리에 올려둔 상태에서 재었고, 입력 해시와 모델이 고른 답이 모두 일치하는지도 확인했다.

더 짧은 278토큰 입력에서는 일반 실행 중앙값이 4.441초, 컴파일 실행 중앙값이 4.469초였다. 이번에는 컴파일 쪽이 0.64% 느렸다. 한 입력에서는 거의 움직이지 않았고 다른 입력에서는 오히려 늦어졌다. 적어도 이 두 조건에서는 컴파일의 속도 이득이 확인되지 않았다.

계산 시간을 나눠 본 결과도 같은 방향을 가리켰다. 432토큰 입력을 범주별로 동기화해 측정하자 피드포워드 신경망에 4.860초, 선형 어텐션에 1.812초, 전체 어텐션에 0.523초가 걸렸다. 계측한 7.198초 중 피드포워드 신경망이 약 67.5%를 차지했다. 다만 동기화가 실행 일정에 영향을 주므로 이 값은 정밀한 가속기 추적 결과가 아니라 병목의 위치를 짚는 진단값이다.

문맥이 길어지면 모델 계산의 무게는 더 커졌다. 1,907토큰 입력은 내용을 자르지 않았을 때 질문 하나당 약 31.5초가 걸렸다. 모델을 계속 올려두면 처음 불러오는 비용은 줄일 수 있어도 문맥 전체를 읽는 순방향 계산은 그대로 남는다. 호출부 컴파일만으로 해결하기 어려운 구간이다.

이번 비교가 컴파일의 보편적 무용함이나 모델의 속도 한계를 증명하지는 않는다. 판단 근거를 보존한 입력 축약, 여러 요청의 묶음 처리, 다른 양자화, 최적화된 커널은 각각 짝을 맞춰 다시 시험해야 한다. 다음 속도 개선은 기능 이름을 더 붙이는 대신 실제 시간을 차지한 계산부터 겨눠야 한다.

2026/10/03 10:22 2026/10/03 10:22