늘모자란, 개발 :: ‘수정 불가’ 한 줄이 검출 점수를 멈춰 세웠다

늘모자란, 개발

구조화 입력으로 다이어그램을 만들고 검사 결과에 따라 자동 수정하는 도구를 평가할 때, 오류 발견만으로는 성공 점수를 줄 수 없다. 한 벤치마크는 진단을 실제 수정 규칙과 연결하지 못하면 ‘수정 불가’로 남겼다. 문제를 알아봤다는 사실과 문제를 고쳤다는 결과를 같은 칸에 넣지 않은 것이다.

시험에는 스키마, ID, 연결 끝점, 라벨, viewBox, 제목, 부제 등 일곱 종류의 결함이 쓰였다. 각 결함이 어느 단계에서 처음 드러났는지, 통과까지 몇 차례 수리가 필요했는지, 뒤늦게 새 오류가 발견됐는지도 따로 기록하도록 구성했다.

수리기는 검사 결과를 구체적인 JSON 수정 규칙으로 바꿨다. 어느 파일의 어떤 필드를 어떻게 고칠지 정할 수 있어야 다음 후보를 만들 수 있다. 진단이 그 단계에 닿지 못하면 오류를 정확히 짚었더라도 자동 수리는 진행되지 않는다.

이 구분은 검출 점수가 실제 성능보다 좋아 보이는 일을 막는다. 다만 해당 벤치마크가 렌더러나 검증 규칙을 개선한 것은 아니며, 모델도 호출하지 않았다. 전체 다이어그램 제작 비용이나 도구의 우열을 측정했다는 주장도 근거 범위를 벗어난다.

자동 수리의 완료 기준은 진단 문구가 아니라 수정된 결과다. 진단이 정확한 소스 변경으로 이어지고, 바뀐 최종 다이어그램이 다시 검사를 통과해야 한다. ‘수정 불가’ 한 줄을 남긴 것은 실패를 숨기지 않았다는 증거이지 수리를 끝냈다는 증거가 아니다.

2026/10/01 10:25 2026/10/01 10:25