늘모자란, 개발 :: 보류를 줄였더니 반대 판단이 네 번 나왔다

늘모자란, 개발

운영 판단을 보조하는 소형 로컬 언어 모델이 8번 모두 판단을 보류했다. 질문을 구체적인 선택형으로 바꾸자 보류는 2번으로 줄었다. 겉으로는 나아진 듯했지만, 4번은 미리 고정한 판정과 반대였다. 답변 수는 늘었고 판단은 더 위험해졌다.

시험에는 실제 과거 결정 네 건을 썼다. 같은 모델에 입력과 질문의 형태를 달리해 읽기 전용 호출 40번을 실행했다. 모델이나 운영 설정은 바꾸지 않았다. 비교하려던 것은 근거의 유무, 질문의 구체성, 입력에 남긴 정보의 범위였다.

처음에는 “다음에는 무엇을 할까”처럼 넓은 질문을 던졌다. 관련 근거가 빠진 조건에서 8번 모두 보류했고, 근거를 채운 조건에서도 다시 8번 모두 보류했다. 자료만 늘려서는 모델이 어느 선택지를 구분해야 하는지 알 수 없었다.

기존의 긴 실행 문맥을 유지한 채 질문과 선택지를 구체화하자 반응은 달라졌다. 8번 중 고정된 판정과 맞은 답은 2번, 반대 답은 4번, 보류는 2번이었다. 보류율만 보면 개선이지만 판정 일치와 모순을 함께 세면 성공이라고 부르기 어려웠다.

이번 판단에 필요한 관찰 사실, 아직 모르는 점, 서로 갈리는 선택지만 남긴 짧은 입력에서는 8번 중 7번이 고정된 판정과 맞았다. 반대 답은 없었고 1번이 보류했다. 같은 구체적 질문이라도 주변 실행 기록을 길게 싣는 것보다 판단 재료를 좁혀 놓은 조건이 네 사례에서는 더 안정적이었다.

표본은 작고 유리하게 골랐을 가능성이 있다. 네 사례를 반복한 것이므로 호출 8번을 독립 사례 8개로 볼 수도 없다. 독립 평가자는 없었고, 선택지 순서를 뒤집자 한 사례가 보류로 바뀌었다. 이 결과로 모델 전체의 정확도나 속도 향상을 주장할 수는 없다.

그래도 한 가지 실패는 분명했다. 보류를 줄이는 것만 목표로 삼으면 모델이 근거 없는 선택을 더 자주 내놓을 수 있다. 판단 보조 모델을 평가할 때는 답변률만 세지 말고, 고정된 기준과의 일치·반대·보류를 함께 봐야 한다. 질문이 무엇을 가르는지 정하지 않은 채 문맥부터 늘리는 방법은 이 시험에서 도움이 되지 않았다.

2026/09/28 10:21 2026/09/28 10:21