운영 판단을 보조하는 소형 로컬 언어 모델은 처음 8번 모두 판단을 보류했다. 질문을 구체적인 선택형으로 바꾸자 보류가 2번으로 줄었지만, 4번은 미리 고정한 판정과 반대였다. 답변이 늘었다는 사실만으로 개선이라고 볼 수 없었고, 오히려 잘못된 판단을 적용할 위험이 커졌다.

시험에는 실제 과거 결정 네 건을 썼다. 같은 모델에 입력과 질문의 형태를 달리해 읽기 전용 호출 40번을 실행했다. 모델이나 운영 설정은 바꾸지 않았다. 비교하려던 것은 근거의 유무, 질문의 구체성, 입력에 남긴 정보의 범위였다.

처음에는 “다음에는 무엇을 할까”처럼 넓은 질문을 사용했다. 관련 근거를 뺀 조건에서 8번 모두 보류했고, 근거를 채워도 다시 8번 모두 보류했다. 자료를 늘리는 것만으로는 어느 선택지를 구분해야 하는지 전달되지 않았다.

긴 실행 문맥은 유지하면서 질문과 선택지를 구체화하자 답이 나오기 시작했다. 8번 가운데 고정된 판정과 맞은 답은 2번, 반대 답은 4번, 보류는 2번이었다. 보류율은 낮아졌지만 판정 일치와 모순을 함께 보면 성공이라고 하기 어려웠다.

이번 판단에 필요한 관찰 사실과 아직 모르는 점, 서로 갈리는 선택지만 남겨 입력을 줄였을 때는 8번 중 7번이 고정된 판정과 맞았다. 반대 답은 없었고 1번은 보류했다. 같은 구체적 질문을 썼어도 주변 실행 기록을 길게 넣은 조건보다 판단 재료를 좁힌 조건이 이 네 사례에서는 더 안정적이었다.

표본은 작고 유리하게 골랐을 가능성이 있다. 네 사례를 반복한 것이므로 호출 8번을 독립 사례 8개로 볼 수도 없다. 독립 평가자는 없었고, 선택지 순서를 뒤집자 한 사례가 보류로 바뀌었다. 이 결과로 모델 전체의 정확도나 속도 향상을 주장할 수는 없다.

이번 시험에서 보류를 줄이는 것만 목표로 삼으면 근거 없는 선택이 늘 수 있다는 실패를 확인했다. 판단 보조 모델을 평가할 때는 답변률과 함께 고정된 기준에 대한 일치·반대·보류를 봐야 한다. 질문으로 무엇을 구분할지 정하지 않은 채 문맥부터 늘리는 방법은 도움이 되지 않았다.

2026/09/28 10:21 2026/09/28 10:21