로컬 270억 매개변수 판단 모델에 432토큰 입력을 넣었을 때, 컴파일 실행은 일반 실행보다 0.004초 빨랐다. 실행 시간이 6.759초에서 6.755초로 줄었지만 차이는 0.07%에 그쳤다. 이 정도로는 실용적인 가속을 얻었다고 보기 어렵다.
같은 두 입력으로 일반 실행과 컴파일 실행을 번갈아 16회 측정했다. 입력 형태별 첫 실행은 준비 비용이 섞이므로 비교에서 뺐고, 나머지는 모델을 메모리에 올려둔 상태에서 재었다. 비교 조건이 달라지지 않았는지 확인하기 위해 입력 해시와 모델이 고른 답도 대조했다. 둘 다 일치했다.
더 짧은 278토큰 입력에서는 결과가 반대였다. 일반 실행 중앙값은 4.441초였고 컴파일 실행 중앙값은 4.469초로, 컴파일 쪽이 0.64% 느렸다. 한 입력에서는 차이가 거의 없고 다른 입력에서는 오히려 늦었으므로, 이 두 조건에서 컴파일의 속도 이득은 확인되지 않았다.
시간이 어디에 쓰이는지 살펴보려고 432토큰 입력의 계산을 범주별로 동기화해 측정했다. 피드포워드 신경망은 4.860초, 선형 어텐션은 1.812초, 전체 어텐션은 0.523초가 걸렸다. 계측한 7.198초 가운데 약 67.5%가 피드포워드 신경망에 쓰였다. 다만 동기화 자체가 실행 일정에 영향을 주기 때문에, 이 수치는 정밀한 가속기 추적 결과보다는 병목의 위치를 짚는 진단값으로 봐야 한다.
문맥이 길어지면 모델 계산의 무게는 더 커졌다. 1,907토큰 입력은 내용을 자르지 않았을 때 질문 하나당 약 31.5초가 걸렸다. 모델을 계속 올려두면 처음 불러오는 비용은 줄일 수 있어도 문맥 전체를 읽는 순방향 계산은 그대로 남는다. 호출부 컴파일만으로 해결하기 어려운 구간이다.
이번 비교만으로 컴파일이 어디서나 무용하다거나 모델이 더 빨라질 수 없다고 말할 수는 없다. 판단 근거를 보존한 입력 축약, 여러 요청의 묶음 처리, 다른 양자화, 최적화된 커널은 각각 조건을 맞춰 다시 시험해야 한다. 다음 속도 개선에서는 실제로 시간을 많이 쓰는 계산을 기준으로 대상을 골라야 한다.