생성
- 구동
- 기록
- 검출
- 정밀
- 실증
Genspark · batch_understand_videos
유튜브 100편의 대본을 읽고 영상마다 같은 질문 6개에 답하게 했다
496 / 600
2026-09-09
5급기록에서 멈춤
업무에 쓰려고 도구를 직접 돌려 보고 본 것을 그대로 적은 기록입니다. 잘 되는 자리를 고른 것이 아니라, 도구가 자기 실패를 어떻게 알리는지를 봤습니다.
낮은 급이 「나쁜 도구」라는 뜻은 아닙니다. 여기 있는 도구들은 대부분 제 몫을 합니다. 다만 잘못된 입력에도 「성공」이라고 답하는 자리에서 멈췄고, 그 자리가 사람이 안 보는 자동화에 넣었을 때 조용히 사고가 되는 곳입니다.
7건 · 등급 매긴 것 6 (등급 있음 4 · 등급 없음 2) · 대조 기록 1
전체 7
수집 3 · 생성 2 · 실행 1 · 대조 1
생성
유튜브 100편의 대본을 읽고 영상마다 같은 질문 6개에 답하게 했다
496 / 600
2026-09-09
5급기록에서 멈춤
수집
생성
실행
수집
수집
성격이 다른 주소 5개를 긁게 했다 — 영문 공식문서, 자바스크립트로 그리는 도움말, 위키백과, 정부 사이트, 없는 주소
2 / 4
2026-09-09
5급기록에서 멈춤
대조
등급 없음 · 두 도구를 맞붙인 기록
같은 질문 3개(영어 2·한국어 1)를 두 도구에 똑같이 던지고 1페이지에 어떤 도메인이 올라오는지 비교했다
10 / 30
2026-09-09
등급 없음
무엇을 시켰는지, 어떻게 쟀는지, 몇 번 반복했는지, 그중 몇 번이 됐는지를 한 장에 적습니다. 하지 않은 시험은 줄이지 않고 「미실시」 칸에 남깁니다. 아래는 실제로 발행한 것입니다.
시험 기록 · genspark-web-search-serp
시험 대상
Genspark · web_search
gsk CLI (2026-09-09 기준)
시험 항목
키워드 25개의 검색 1페이지에 어떤 사이트가 올라오는지 뽑게 했다
시험 방법
정밀은 이렇게 쟀다 — 키워드 3개(영어 1·한국어 1·영어 1)를 각각 3회씩, 같은 날 연속으로 넣고 상위 결과 목록을 비교했다. 9번의 비교에서 순서까지 전부 같았다. 각 회차는 9개씩 돌려줬다.
이 기록은 판정기준 v1.0 제정 전에 시험한 것이라 재현 절차가 네 단계로 남아 있지 않습니다.
시험 횟수
25키워드 중 응답
결과
25 / 25
한국어·영어 둘 다 돌아간다. 25개 전부 결과가 왔고, 같은 키워드를 다시 넣으면 같은 답이 나온다.
판정
5급 · 기록에서 멈춤
관측된 실패
요청한 10개를 다 주지 않는다. 키워드마다 6~10개로 갈린다(같은 키워드 안에서는 일정하다). 모자란 이유는 알려 주지 않는다.
미실시 항목
검출 · 실증2개 급 미실시
같은 날 안에서만 재봤다. 날짜를 바꿔 넣었을 때 결과가 얼마나 움직이는지는 아직 모른다. 상위에 뜬 페이지를 열어 실제로 그 내용인지 확인하는 것(실증)도 하지 않았다.
해당 없음
정밀1개 급 · 이 대상에는 성립하지 않음
2급 정밀은 정상 표본을 잘못 지적하지 않는지를 봅니다. 이 도구는 검색 결과를 가져올 뿐 옳고 그름을 판정하지 않으므로 오탐이라는 것이 성립하지 않습니다(§4.8.4).
기록일
2026-09-09
유효 조건
위에 적은 버전과 시험 항목에 한해 유효합니다. 도구가 갱신되면 이 성적은 실효하고 처음부터 다시 잽니다. 다른 작업을 시키면 다른 결과가 나옵니다.
이 사다리는 남의 도구를 재려고 만든 것이 아니라, 우리가 업무에 쓰는 도구를 결재하려고 만든 것입니다. 위 기록과 별개로 사내 도구 24건이 같은 사다리에 올라가 있습니다.
사내 도구라 기록서는 공개하지 않습니다. 여기 적는 것은 숫자뿐입니다. 이 잣대가 남에게만 센 것이 아니라는 것을 보이려고 적습니다 — 우리가 만든 도구도 대부분 요구등급에 못 미쳤습니다.