구조화 입력으로 다이어그램을 만들고 검사 결과에 따라 자동 수정하는 도구에서는 오류를 발견한 것과 수리를 끝낸 것을 구분해야 한다. 한 벤치마크는 진단을 실제 수정 규칙으로 연결하지 못하면 ‘수정 불가’로 남겼다. 발견했다는 이유만으로 성공 점수를 주지 않은 것이다.
시험에는 스키마, ID, 연결 끝점, 라벨, viewBox, 제목, 부제에 관한 일곱 종류의 결함을 넣었다. 결함마다 처음 드러난 단계와 통과까지 필요한 수리 횟수를 기록하고, 수리 도중 뒤늦게 새 오류가 발견됐는지도 따로 남기도록 구성했다.
수리기는 검사 결과를 구체적인 JSON 수정 규칙으로 바꿔 다음 후보를 만들었다. 그러려면 어느 파일의 어떤 필드를 어떻게 바꿀지까지 정할 수 있어야 한다. 진단이 정확해도 이 변경을 지정하지 못하면 자동 수리는 진행되지 않는다.
이 구분은 검출 점수가 실제 성능보다 좋아 보이는 일을 막는다. 다만 해당 벤치마크가 렌더러나 검증 규칙을 개선한 것은 아니며, 모델도 호출하지 않았다. 전체 다이어그램 제작 비용이나 도구의 우열을 측정했다는 주장도 근거 범위를 벗어난다.
자동 수리는 진단이 정확한 소스 변경으로 이어지고 최종 다이어그램이 재검사를 통과했을 때 끝난다. 진단 문구만으로 완료를 판정하면 발견과 수리 사이의 실패가 가려진다. ‘수정 불가’를 남긴 것은 그 실패를 숨기지 않았다는 증거이며, 수리를 끝냈다는 증거는 아니다.