AI 아버지

실측 기록

업무에 쓰려고 도구를 직접 돌려 보고 본 것을 그대로 적은 기록입니다. 잘 되는 자리를 고른 것이 아니라, 도구가 자기 실패를 어떻게 알리는지를 봤습니다.

낮은 급이 「나쁜 도구」라는 뜻은 아닙니다. 여기 있는 도구들은 대부분 제 몫을 합니다. 다만 잘못된 입력에도 「성공」이라고 답하는 자리에서 멈췄고, 그 자리가 사람이 안 보는 자동화에 넣었을 때 조용히 사고가 되는 곳입니다.

7건 · 등급 매긴 것 6 (등급 있음 4 · 등급 없음 2) · 대조 기록 1

전체 7

수집 3 · 생성 2 · 실행 1 · 대조 1

생성

  1. 구동
  2. 기록
  3. 검출
  4. 정밀
  5. 실증

Genspark · batch_understand_videos

유튜브 100편의 대본을 읽고 영상마다 같은 질문 6개에 답하게 했다

496 / 600

2026-09-09

5급기록에서 멈춤

수집

  1. 구동
  2. 기록
  3. 검출
  4. 정밀
  5. 실증

Genspark · web_search

키워드 25개의 검색 1페이지에 어떤 사이트가 올라오는지 뽑게 했다

25 / 25

2026-09-09

5급기록에서 멈춤

생성

  1. 구동
  2. 기록
  3. 검출
  4. 정밀
  5. 실증

Codex CLI · GPT-6 Astra

네이버·구글 공식문서만 보고 광고 수익 조사 보고서를 쓰게 했다

1 / 2

2026-09-09

등급 없음

실행

  1. 구동
  2. 기록
  3. 검출
  4. 정밀
  5. 실증

TwelveLabs · Gemini MCP 서버

영상 이해와 교차검증에 쓰려고 붙였다

기재 없음

2026-09-09

등급 없음

수집

  1. 구동
  2. 기록
  3. 검출
  4. 정밀
  5. 실증

Genspark · yt transcript

없는 영상 ID 두 개를 일부러 넣고, 도구가 실패를 알리는지 봤다

0 / 2

2026-09-09

5급기록에서 멈춤

수집

  1. 구동
  2. 기록
  3. 검출
  4. 정밀
  5. 실증

Genspark · crawl (Windows)

성격이 다른 주소 5개를 긁게 했다 — 영문 공식문서, 자바스크립트로 그리는 도움말, 위키백과, 정부 사이트, 없는 주소

2 / 4

2026-09-09

5급기록에서 멈춤

유형에 따라 3급에서 재는 것이 다릅니다

검사
판정을 내놓는다. 결함 표본을 전건 찾는가
수집
밖에 있던 것을 가져온다. 없는 대상·잘못된 주소를 거부하는가
생성
없던 내용을 만든다. 근거 없는 것을 사실처럼 쓰지 않는가
실행
시킨 일을 수행한다. 잘못된 인자·조건을 거부하는가

서식 견본

무엇을 시켰는지, 어떻게 쟀는지, 몇 번 반복했는지, 그중 몇 번이 됐는지를 한 장에 적습니다. 하지 않은 시험은 줄이지 않고 「미실시」 칸에 남깁니다. 아래는 실제로 발행한 것입니다.

시험 기록 · genspark-web-search-serp

Genspark · web_search

시험 대상

Genspark · web_search

gsk CLI (2026-09-09 기준)

시험 항목

키워드 25개의 검색 1페이지에 어떤 사이트가 올라오는지 뽑게 했다

시험 방법

정밀은 이렇게 쟀다 — 키워드 3개(영어 1·한국어 1·영어 1)를 각각 3회씩, 같은 날 연속으로 넣고 상위 결과 목록을 비교했다. 9번의 비교에서 순서까지 전부 같았다. 각 회차는 9개씩 돌려줬다.

이 기록은 판정기준 v1.0 제정 전에 시험한 것이라 재현 절차가 네 단계로 남아 있지 않습니다.

시험 횟수

25키워드 중 응답

결과

25 / 25

한국어·영어 둘 다 돌아간다. 25개 전부 결과가 왔고, 같은 키워드를 다시 넣으면 같은 답이 나온다.

판정

5급 · 기록에서 멈춤

  1. 구동
  2. 기록
  3. 검출
  4. 정밀
  5. 실증

관측된 실패

요청한 10개를 다 주지 않는다. 키워드마다 6~10개로 갈린다(같은 키워드 안에서는 일정하다). 모자란 이유는 알려 주지 않는다.

미실시 항목

검출 · 실증2개 급 미실시

같은 날 안에서만 재봤다. 날짜를 바꿔 넣었을 때 결과가 얼마나 움직이는지는 아직 모른다. 상위에 뜬 페이지를 열어 실제로 그 내용인지 확인하는 것(실증)도 하지 않았다.

해당 없음

정밀1개 급 · 이 대상에는 성립하지 않음

2급 정밀은 정상 표본을 잘못 지적하지 않는지를 봅니다. 이 도구는 검색 결과를 가져올 뿐 옳고 그름을 판정하지 않으므로 오탐이라는 것이 성립하지 않습니다(§4.8.4).

기록일

2026-09-09

유효 조건

위에 적은 버전과 시험 항목에 한해 유효합니다. 도구가 갱신되면 이 성적은 실효하고 처음부터 다시 잽니다. 다른 작업을 시키면 다른 결과가 나옵니다.

우리 도구에 먼저 댄 결과

이 사다리는 남의 도구를 재려고 만든 것이 아니라, 우리가 업무에 쓰는 도구를 결재하려고 만든 것입니다. 위 기록과 별개로 사내 도구 24건이 같은 사다리에 올라가 있습니다.

24건
같은 사다리에 등재
8건
채점 완료. 나머지 16건은 표본이 없어 채점 자체를 못 합니다 — 안 한 것을 통과로 세지 않습니다
2건
채점한 8건 중 요구등급을 채운 것
1건
1급이 필요한 17건 중 실제로 1급을 받은 것
2건
0급. 구동에서 떨어진 것

사내 도구라 기록서는 공개하지 않습니다. 여기 적는 것은 숫자뿐입니다. 이 잣대가 남에게만 센 것이 아니라는 것을 보이려고 적습니다 — 우리가 만든 도구도 대부분 요구등급에 못 미쳤습니다.

무엇을 근거로 이 급을 매겼는지는 판정기준 v1.0에, 시험을 어떤 조건으로 받는지는 시험기준 v1.0에 있습니다. 어느 조항이 틀렸는지 알려 주시면 고칩니다.