AI 아버지

판정기준 v1.0

제정 2026-09-10 · 시행 2026-09-10

이 문서는 AI 아버지가 AI 도구를 시험하고 등급을 매길 때 쓰는 기준입니다. 성적서의 「시험방법」 칸에 적힌 v1.0 §4.2 같은 표기는 이 문서의 조항을 가리킵니다.

제정 경위 — 먼저 밝힙니다

판정기준 v1.0은 이미 공개한 기록 7건의 결과와 판정상 문제를 검토한 뒤 처음 문서화한 기준입니다. 그 기록을 시험할 당시 이 기준이 사전에 확정되어 있었던 것은 아닙니다. 기존 등급에는 당시의 정성 판단과 지금과 다른 공개 설명이 적용되었습니다.

v1.0 시행 이후의 새 시험은 실행 전에 시험계획을 확정합니다. 기존 기록은 원본과 당시 판정을 보존한 채, v1.0에 따른 재평가를 별도로 공개합니다. 당시 증거로 확인할 수 없는 요건은 충족한 것으로 간주하지 않습니다.


1. 적용 범위

1.1 이 기준은 특정 버전·기능·용도·환경·설정의 조합을 평가합니다. 도구 전체를 평가하지 않습니다.

1.2 성적서의 결과와 등급은 기재된 시험 대상·버전·작업·조건에서 확인한 범위에 한합니다. 다른 조건이나 이후 실행에서 같은 결과가 나오는 것을 보증하지 않습니다.

1.3 이 기준의 모든 「전건」·「0건」 판정은 시험한 표본 안에서의 결과입니다. 모든 입력에서 무오류라는 뜻이 아닙니다.

1.4 이 기준에 따른 판정은 AI 아버지가 공개한 자체 기준에 따른 평가이며, 공인인증이나 해당 도구 전반의 품질·안전성에 대한 보증을 뜻하지 않습니다.

2. 등급 구조

2.1 등급은 5급에서 1급으로 올라가며, 1급이 가장 높습니다.

2.2 하위 급을 통과해야 상위 급을 인정합니다. 건너뛸 수 없습니다. 3급을 시험하지 않았거나 통과하지 못했다면, 2급 조건을 충족했더라도 2급을 인정하지 않습니다.

2.3 인정등급은 연속으로 통과가 입증된 최상위 급입니다.

2.4 인정등급과 시험 중단 지점은 따로 적습니다. 「2급인데 3급에서 멈춤」 같은 표기는 이 기준에서 성립하지 않습니다.

2.5 5급을 통과하지 못한 경우는 「등급 없음 — 구동 실패」로 적습니다. 5급이 구동 통과를 뜻하므로 크래시·연결 실패를 5급이라 적을 수 없습니다.

2.6 시험 중단 지점은 하위 급부터 세어 연속 충족이 처음 끊긴 급입니다. 그보다 위의 급을 실제로 시험해 미충족이 나왔다면 그 판정도 그대로 적습니다 — §2.2 는 상위 급의 «인정» 을 막는 조항이지 «기록» 을 막는 조항이 아닙니다. 다만 중단 지점은 하나뿐이므로, 그 위의 미충족은 중단 지점과 구별해 표시합니다.

3. 판정 상태

3.1 각 급의 판정은 다섯 중 하나입니다.

상태
충족그 급의 통과 조건을 시험해 충족했다
미충족시험했고 통과 조건에 못 미쳤다
미실시시험할 수 있었으나 하지 않았다
해당 없음이 대상에는 그 급이 성립하지 않는다
증거 부족시험했다는 기록은 있으나 판정할 증거가 남아 있지 않다

3.2 미실시를 충족이나 미충족으로 바꾸지 않습니다. 성적서에서 미실시 칸은 비우지 않고 「미실시」로 적습니다.

3.3 「미실시」와 「해당 없음」은 다른 말입니다.

둘을 같은 칸에 적으면 「우리가 게을렀다」와 「이 도구엔 그 질문이 안 선다」가 구별되지 않습니다.

3.4 「해당 없음」은 사다리를 끊지 않습니다. 그 급을 건너뛰고 다음 급으로 갑니다. 다만 성적서에 왜 성립하지 않는지를 적어야 하고, 그 사유는 §4.8의 대상 유형으로 설명되어야 합니다. 사유 없이 「해당 없음」으로 적으면 §2.2(건너뛰기 금지)를 우회하는 구멍이 됩니다.

3.5 「해당 없음」인 급은 인정등급 산정에서 빠집니다. 성적서에는 4급 (3급 해당 없음)처럼 무엇이 빠졌는지 드러나게 적습니다.

3.6 성적서는 1급 기준 한 서식으로 씁니다. 하지 않은 시험을 줄여서 적지 않습니다. 줄여 놓으면 다 한 것처럼 읽힙니다.

4. 급별 통과 조건

4.0 공통 — 평가자는 실행 전에 시험계획을 확정합니다. 결과를 확인한 뒤의 변경은 기존 시험에 적용하지 않고 별도 시험으로 발행합니다.

시험계획에 적는 것:

항목내용
평가 범위대상 버전·기능·용도·환경·설정
필수 시험 유형결함 유형과 정상 유형을 각각
표본별 기대 결과참값(정답표). 실행 전에 준비되어 있어야 합니다
항목별 반복 횟수항목마다 다를 수 있습니다. §4.7
측정 제외 구간워밍업 등. §5.10
성능 임계값성능 항목이 있으면 실행 전에 지정합니다. §11
제한시간 · 재시도 정책
성공 신호상태값·종료코드·본문 중 무엇을 성공으로 볼지

4.0.1 시험 방법은 재현할 수 있게 적습니다. 성적서의 「시험 방법」 칸은 산문이 아니라 다음 네 단계로 적습니다. 남이 같은 절차로 다시 돌려볼 수 있어야 합니다.

> (1) 준비 — 시험데이터와 참값이 어디에 있어야 하는지 > (2) 실행 — 실제 명령 또는 조작 절차. 결과가 저장되는 파일명 > (3) 대조 — 참값과 결과를 무슨 기준으로 맞추는지 > (4) 확인 — 출력에서 어느 값을 읽는지

4.1 · 5급 구동 — 시험계획에 포함된 모든 실행이 지정된 환경과 제한시간 안에 종료되고, 규정된 형식의 최종 응답 또는 결과물을 반환해야 합니다. 크래시·시간 초과·연결 실패·예정하지 않은 입력 대기로 완료하지 못한 실행이 1건이라도 있으면 미충족입니다.

4.2 · 4급 기록 — 입력의 각 집계 단위가 결과 기록과 대응해야 하며, 요청 수는 처리 완료·실패·미처리 수의 합과 일치해야 합니다. 실패·미처리·부분 처리를 전체 성공으로 보고한 건수가 0건이고, 본문·상태값·종료코드 사이의 성공 여부 모순이 0건이어야 합니다. 사전 지정한 관문 무력화 시험에서 정상 통과를 보고한 건수가 0건이어야 합니다.

4.3 · 3급 검출 — 시험계획의 모든 필수 결함 유형을 시험하고, 범위 안의 유효한 결함 표본을 전건 검출해야 합니다. 미탐과 강등은 각각 0건이어야 합니다. 검출은 사전에 지정한 실패·차단 신호에 반영된 경우에만 인정합니다.

4.4 · 2급 정밀 — 시험계획의 모든 필수 정상 유형을 시험하고, 유효한 정상 표본에서 오탐이 0건이어야 합니다. 정상 대조군은 모두 경고 없는 통과 상태에 도달해야 합니다. 표본 작성자와 다른 채점자가 판정하고, 채점자 외 독립 검수자 1인 이상이 정답표·원본 출력·분류 결과를 교차검수해야 합니다.

4.5 · 1급 실증실제로 발생한 사고 3건 이상에 대해 발생 사실과 사고 조건을 증빙하고, 사고 당시 입력 및 핵심 조건을 재구성해 시험해야 합니다. 각 사례에서 사고로 이어지는 조치가 실행되기 전에 경고·차단 절차가 작동했음을 확인해야 합니다. 실제 업무 절차에 연결되는 대응 주체와 조치를 명시하고, 최종 책임자가 결과와 적용 범위에 서명해야 합니다.

4.6 1급이 입증하는 것은 「실제 사고 사례에서 차단 가능성을 확인했다」입니다. 운영 중 실제로 막은 사고를 관찰하지 않았다면 「실제 사고를 막았다」고 적지 않습니다. 성적서에는 사고 재현 검증운영 중 차단 관찰을 구분해 표시합니다.

4.7 반복 횟수는 항목마다 정합니다. 모든 항목을 같은 횟수로 돌리지 않습니다. 무엇을 몇 번 돌릴지는 그 항목이 흔들리는 정도와 한 번 도는 데 드는 비용으로 정하고, 실행 전에 시험계획에 적습니다. 성적서에는 항목별 횟수를 그대로 표시합니다.

표본 수가 다른 성적서를 같은 강도의 증거로 취급하지 않습니다. 50회 중 49회와 2회 중 1회는 같은 말이 아닙니다.

4.8 급의 질문은 같고, 재는 항목은 대상마다 다릅니다.

§4.1~4.5의 통과 조건은 결함을 주입하고 찾게 하는 도구를 전제로 쓰여 있습니다. 그 전제가 서지 않는 대상이 있습니다. 검색 도구에는 주입할 결함도 정상 대조군도 없습니다.

그래서 급이 묻는 것은 그대로 두고, 그것을 재는 항목을 대상 유형에 맞춰 정합니다.

묻는 것 (모든 유형 공통)
5급 구동죽지 않고 끝까지 도는가
4급 기록자기가 못 한 것을 드러내는가
3급 검출주어진 것 중 틀린 것을 알아채는가
2급 정밀멀쩡한 것을 틀렸다고 하지 않는가
1급 실증실제 사고를 막는가

4.8.1 대상 유형 — 그 도구의 주된 산출물이 무엇인가로 가릅니다.

유형무엇을 내놓나3급 검출에서 재는 것
검사판정결함 표본을 전건 찾는가
수집밖에 있던 것없는 대상·잘못된 주소를 거부하는가
생성없던 내용근거 없는 것을 사실처럼 쓰지 않는가
실행수행 결과잘못된 인자·조건을 거부하는가

4.8.2 유형은 시험계획에 적고, 성적서에 표시합니다. 유형을 바꾸면 재는 항목이 바뀌므로 다른 시험입니다.

4.8.3 한 도구가 여러 유형에 걸치면 그 시험에서 시킨 작업 기준으로 하나를 고릅니다. 도구 전체가 아니라 그 작업을 평가하기 때문입니다(§1.1).

4.8.4 유형으로도 성립하지 않는 급은 「해당 없음」입니다(§3.4). 예를 들어 2급 정밀은 「멀쩡한 것을 틀렸다고 하지 않는가」인데, 애초에 판정을 내놓지 않는 수집 도구에는 오탐이라는 것이 없습니다.

🚨 유형을 골라 놓고 그 유형의 항목을 안 재면 「미실시」이지 「해당 없음」이 아닙니다. 유형은 잴 것을 정하는 장치이지 빠져나가는 문이 아닙니다.

5. 결과를 세는 법

5.1 결함 판정과 제외 사유는 여섯 갈래로만 집계합니다.

갈래
검출결함을 지정된 실패·차단 신호로 알렸다
미탐결함을 놓쳤다
강등의심·참고에만 표시하고 종료코드·차단 신호에 싣지 않았다
오탐정상인데 결함이라고 지적했다
범위밖평가 범위 밖이라 제외했다
입력결함시험자료 자체가 손상되어 제외했다

5.2 강등은 원자료에 따로 적되, 검출률에서는 미탐과 같이 셉니다. 검출률 = 검출 ÷ (검출 + 미탐 + 강등)

5.3 범위밖 제외는 결과 확인 전에 확정된 평가 범위 문서로 입증해야 합니다. 제외 건수와 사유는 공개합니다.

5.4 입력결함은 점수에서 빼되 건수는 반드시 적습니다. 다만 잘못된 입력을 거부하는지 시험하려고 의도적으로 넣은 표본은 입력결함이 아닙니다. 그 표본의 기대 결과는 「정상적인 거부」입니다.

5.5 정상 표본의 총수와 정상 통과 수는 별도 필수 항목으로 적습니다. 정상 표본에 아무 경고도 없는 경우는 위 여섯 갈래에 들어가지 않습니다.

5.6 실행 실패(크래시·시간 초과·연결 실패)는 여섯 갈래와 별도로 실행 상태에 적습니다. 크래시는 미탐이 아니라 구동 실패입니다.

5.7 한 문서에 결함이 여럿이면 결함별로 검출 여부를 세고 문서 수는 따로 적습니다. 같은 결함을 열 번 지적했다고 검출 열 건으로 세지 않습니다.

5.8 성적은 「N 중 k」로 적고 비율로 뭉개지 않습니다. 단위는 실제 측정 단위(회·문항·키워드·주소·건)를 그대로 씁니다.

5.9 실패한 회차를 지우지 않습니다.

5.10 측정에서 빼는 구간은 실행 전에 정합니다. 첫 회차가 느린 도구가 있습니다(모델 적재·연결 수립·캐시 예열). 이런 구간을 측정에서 빼려면 몇 회를 뺄지 실행 전에 시험계획에 적어야 합니다.

6. 즉시 미충족

6.1 관문 무력화 — 필수 검사·검증 절차가 실행되지 않거나 효과를 잃은 상태입니다. 그런데도 정상 통과로 보고하면 4급 미충족입니다.

6.2 상시 오경고 — 정상 입력에 필연적으로 경고가 발생하는 구조가 확인되면 2급 미충족입니다. 빨간불이 늘 켜져 있으면 사람이 경고를 무시하게 되므로, 뚫리는 것만큼 위험하다고 봅니다.

7. 채점 독립성

7.1 채점자는 도구와 시험자료를 수정할 수 없습니다.

7.2 자기가 만든 표본을 자기가 채점할 수 없습니다.

7.3 2급 이상은 채점자 외 독립 검수자 1인 이상이 교차검수합니다.

7.4 채점 담당은 순환합니다. 이해충돌이 있으면 그 건을 맡지 않습니다.

7.5 정답이 시험자 밖에서 확정되는 표본 — 「없는 영상 ID」·「응답하지 않는 주소」·「형식을 위반한 입력」처럼 정답이 시험자의 판단이 아니라 외부 원천으로 확정되는 표본이 있습니다. 이런 표본은 만든 사람이 채점해도 §7.2가 막으려는 위험(자기 의도대로 해석하는 것)이 생기지 않습니다. 이 경우에 한해 §7.2를 적용하지 않되, 다음을 지킵니다.

8. 증거 보존

8.1 원본 입력·출력·로그·실행 시각·대상 버전·실행 환경·사람의 개입 기록을 보존합니다.

8.2 증거가 없으면 그 급은 「증거 부족」입니다. 있었을 것으로 간주하지 않습니다.

9. 인정의 효력과 재시험

9.1 인정등급은 평가한 코드·모델·프롬프트·설정·의존성·실행환경의 조합에 한정합니다. 그 조합이 변경되면 기존 등급을 변경된 대상에 승계하지 않습니다.

9.2 기존 성적서는 평가 당시 대상에 대한 기록으로 보존합니다. 새 시험은 새 번호로 발행하고 「이전 성적서를 대체함」을 적습니다.

9.3 버전을 고정하거나 확인할 수 없는 서비스형 도구는 평가 일시와 식별 가능한 정보를 표시하고, 현재 버전에도 같은 결과가 유지된다고 보증하지 않습니다.

9.4 원래 적용한 기준에서도 잘못된 판정이었다면 기준 개정을 기다리지 않고 성적서를 정정하거나 등급을 철회합니다. 원문·정정 사유·정정일·대체 성적서를 서로 연결해 공개합니다.

10. 등급을 붙이지 않는 기록

10.1 대조 기록 — 두 도구를 같은 과제로 맞붙여 결과가 얼마나 갈리는지만 보는 기록입니다. 등급을 붙이지 않고, 어느 쪽이 낫다고도 말하지 않습니다. 정답표 없이 검출·오탐을 판정할 수 없기 때문입니다.

10.2 재현성 — 지정한 입력·환경·시간 조건에서 반복 실행한 결과의 일치 정도입니다. 비교 대상과 허용 차이를 함께 적습니다. 재현성 결과만으로 인정등급을 올리지 않습니다. 같은 오답을 매번 내는 도구는 재현성이 높아도 정확하지 않기 때문입니다. 특정 업무에서 재현성이 필수라면 그 시험계획의 추가 통과 조건으로 미리 지정합니다.

11. 성능 항목과 기능 항목

11.1 시험 항목은 두 갈래입니다.

갈래무엇을 묻나판정 방식
기능 항목되는가, 안 되는가전건 / 0건
성능 항목얼마나 잘 되는가사전에 지정한 임계값과 비교

11.2 이 기준의 다섯 급은 기본이 기능 항목입니다. 「전건 검출」·「오탐 0건」·「모순 0건」처럼 셉니다.

11.3 다만 성능 항목을 함께 잴 수 있습니다. 정확도·재현율·정합률·응답시간처럼 수치로 나오는 것이 그렇습니다. 이때 임계값을 실행 전에 시험계획에 지정해야 합니다.

🚨 결과를 본 뒤에 임계값을 정하지 않습니다. 「98%가 나왔으니 합격선을 95%로 하자」는 사후 정당화입니다. 그렇게 만든 수치는 판정의 근거가 되지 못합니다.

11.4 임계값에는 근거가 있어야 합니다. 업계에 통용되는 보편적 합격선은 없습니다. 「이 업무에서 이 수치를 못 넘기면 사람이 다시 봐야 한다」처럼 그 업무에서 왜 그 선인지를 함께 적습니다.

11.5 성능 항목이 임계값을 넘겨도 기능 항목의 미충족을 덮지 못합니다. 정확도가 아무리 높아도 실패를 성공으로 보고하면 4급에서 멈춥니다. 성공 건수가 많다는 사실은 실패를 알리지 못한 결함을 상쇄하지 않습니다.

11.6 성능 항목은 성적서에 측정값·임계값·판정을 나란히 적습니다. 임계값 없이 수치만 적으면 읽는 사람이 스스로 합격선을 지어내게 됩니다.

12. 이 기준의 버전 관리

12.1

변경버전
급 정의·통과선·필수 시험·제외 규칙·독립성 요건이 달라짐주 버전 v1 → v2
판정에 영향을 주지 않는 설명·예시 추가부 버전 v1.0 → v1.1
오탈자·링크 수정수정 버전 v1.0.0 → v1.0.1

12.2 「설명 보완」이라 이름 붙였어도 같은 증거의 통과 여부가 달라진다면 주 버전을 올립니다.

12.3 각 버전에는 발행일·시행일·변경 이유·이전 버전과의 차이를 남기고, 이전 문서를 덮어쓰지 않습니다.

12.4 v2.0이 나와도 v1.0 성적서가 자동으로 무효가 되지는 않습니다. v1.0에서 무엇을 확인했는지에 관한 기록으로 유지합니다. 다만 v2.0을 통과한 것처럼 표시할 수 없습니다.

> 4급 · 판정기준 v1.0 · 도구 버전 X > v2.0 기준 재평가: 미실시


문의 — 이 기준에 이의가 있거나 판정이 잘못되었다고 보시면 [문의](/ko/contact)로 알려 주십시오. 원문 증거와 함께 다시 확인하고, 잘못이면 정정 이력과 함께 공개합니다.