💬말로 만드는 AI▶ 유튜브
⚡ 따라 하기 · 18

AI 가 좋아졌는지 점수로 재기 — 시험지 만들고 매일 채점하기

이 페이지 목차시작 전에1단계 · 연습용 자료와 검색 만들기2단계 · 시험지 만들기3단계 · 채점해서 점수 보기4단계 · 틀린 문제만 보기5단계 · 검색을 고치고 전·후 점수 비교하기6단계 · 점수가 안 오를 때는 시험지부터 의심하기7단계 · 처음 보는 새 문제로 다시 재기8단계 · 매일 아침 채점하고, 나빠질 때만 알리게 하려면 (예시 답)다 됐습니다 — 이제 이렇게 말하면 됩니다막히면한 번에 맡기기 (익숙해진 다음에)내가 만들 때는

클로드에게 검색이나 자동 답변을 고치게 하면 매번 「고쳤습니다, 더 좋아졌습니다」라는 말이 돌아옵니다. 정말 좋아졌는지는 말만으로는 알 수 없습니다. 그래서 답을 아는 문제 모음(시험지)을 먼저 만들어 두고, 고칠 때마다 같은 시험지로 채점합니다. 아래 말을 순서대로 한 줄씩 치면 됩니다. (예시 자료는 가짜 이름입니다. 클로드의 답은 2026-10-11 에 실제로 돌려 받은 것을 줄였고, 줄인 곳은 「…」로 표시했습니다. **8단계만 「예시 답」**입니다. 문제와 점수는 클로드를 열 때마다 달라지니, 내 화면의 숫자가 다른 것은 정상입니다.)

시작 전에

  • 빈 폴더 하나를 만들고(이름은 영문으로, 예: 문서 폴더 안 score-ai), 그 폴더에서 클로드(Claude Code)를 엽니다. 여는 법과 승인 방식은 02편 「시작 전에」와 같습니다.
  • Node.js 가 PC 에 있어야 합니다(채점 파일을 node 로 돌립니다). 없다면 06편 「준비물 자세히」의 Node.js 안내를 따르세요. 그 밖에 따로 설치할 것은 없습니다.
  • 클로드가 파일을 만들거나 명령을 실행하려고 허락을 물으면 무엇을 하는지 읽고 허락하세요. 이 편에서는 node 로 시작하는 명령이 나옵니다.
  • 이 편의 글은 가짜입니다. 내 자료로 할 때는 개인정보·급여·반출금지 자료가 든 글은 넣지 마세요. 클로드가 읽은 부분은 클로드에게 전달됩니다.
준비물 자세히 (용어)
  • 시험지는 「문제」와 「정답」이 한 쌍씩 들어 있는 목록입니다. 여기서는 「이 질문을 검색하면 이 글이 1등으로 나와야 한다」는 목록입니다. (제작 기록실에서는 「자」라고도 불렀습니다. 길이를 재는 자처럼, 좋아졌는지를 재는 도구라는 뜻입니다.)
  • 채점은 시험지의 문제를 하나씩 검색에 넣어 보고, 정답이 1등으로 나오면 맞은 것으로 세는 일입니다. 점수는 「맞은 수/전체」(예: 7/10)입니다.
  • 기준선은 고치기 전 점수입니다. 이 점수가 있어야 고친 뒤에 「올랐나 내렸나」를 말할 수 있습니다.
  • 헛점수는 채점 규칙이 틀려서 실제와 다르게 나온 점수입니다. 시험지의 정답이 틀렸을 때도 같은 일이 생깁니다.

1단계 · 연습용 자료와 검색 만들기

점수를 잴 대상이 먼저 필요합니다. 가짜 회사 「가나다전자」의 자주 묻는 질문 글 15개와, 낱말이 몇 번 나오는지 세기만 하는 아주 단순한 검색을 클로드에게 만들게 합니다. (이미 내 검색이 있다면 이 단계는 건너뛰고, 아래 말에서 「search.js」 자리를 내 검색으로 바꿔 말하세요.)

✅ 이렇게 나오면 성공 — 폴더에 faq 폴더(글 15개)와 search.js 가 생기고, 사용법(node search.js 낱말)이 보이면 다음 단계로. 일부러 허술한 검색입니다. 고칠 자리가 있어야 점수가 움직이는 것을 볼 수 있습니다.

2단계 · 시험지 만들기

시험지는 검색 결과를 보기 전에 만듭니다. 검색을 먼저 돌려 보고 만들면 검색이 잘 찾는 문제만 남기 쉽기 때문입니다(제 판단입니다). 그래서 말 끝에 「채점은 아직 하지 마」를 붙입니다.

✅ 이렇게 나오면 성공 — 폴더에 시험지 파일(이 편에서는 testset.json. 이름은 클로드마다 다를 수 있습니다)이 생기고 문제 10개와 정답 글 이름이 보이면 다음 단계로. 위처럼 클로드가 **스스로 「이 정답은 애매하다」**고 짚으면 잘 된 것입니다. 이 말은 「막히면」 3번에서 씁니다. (검색까지 돌려 버리면 「막히면」 1번.)

3단계 · 채점해서 점수 보기

시험지가 생겼으니 채점합니다. 점수를 기록 파일에도 남기게 해 두면 나중에 「그때 몇 점이었더라」가 필요 없습니다.

✅ 이렇게 나오면 성공 — 「7/10」 같은 점수가 나오고 폴더에 채점 파일과 기록 파일(이 편에서는 grade.js·scores.log. 이름은 달라도 됩니다)이 생기면 다음 단계로. 이 점수가 기준선입니다. 적어 두세요. 두 가지를 알아 두세요. ① 문제가 10개라 한 문제가 10점이어서 점수가 크게 출렁입니다. 숫자 하나보다 어느 문제를 틀렸는지가 더 중요합니다. ② 「정답이 혼자 1등일 때만 맞다」 같은 채점 규칙은 클로드가 정한 것이고, 규칙이 바뀌면 점수도 바뀝니다(헛점수). 한 번은 읽어 보세요.

4단계 · 틀린 문제만 보기

점수 다음에는 틀린 문제를 봅니다. 검색이 1~3위로 뭘 내놨는지를 같이 보면, 검색의 어디가 약한지 보입니다.

✅ 이렇게 나오면 성공 — 틀린 문제마다 「정답은 무엇이고, 검색은 무엇을 1위로 줬나」가 보이면 다음 단계로. 이유는 클로드의 짐작일 수 있습니다. 6단계에서 확인합니다.

5단계 · 검색을 고치고 전·후 점수 비교하기

이제 고칩니다. **「시험지는 건드리지 말고」**를 꼭 붙이세요. 고치는 쪽이 시험지를 바꿀 수 있으면, 점수를 올리는 가장 쉬운 길이 「정답을 고치는 것」이 되어 버립니다.

✅ 이렇게 나오면 성공 — 「전 → 후」 점수와 원래 맞던 문제 중 새로 틀린 것이 있는지가 함께 보이면 다음 단계로. 점수가 안 오르거나 오히려 떨어졌어도 정상입니다. 다음 단계가 바로 그때 하는 일입니다. (「다른 에이전트」는 클로드가 따로 불러 일을 시킨 도우미입니다. 어떻게 고치는지는 클로드마다 다릅니다.)

6단계 · 점수가 안 오를 때는 시험지부터 의심하기

점수가 안 오르거나 떨어지면 검색을 또 고치고 싶어집니다. 그 전에, 틀린 문제의 정답이 정말 맞는지부터 확인합니다. 시험지가 틀렸는데 검색을 고치면 멀쩡한 개선을 버리거나 엉뚱한 곳을 고치게 됩니다. 이 편에서는 아직 틀린 6번·7번으로 해 봅니다. 내 화면에서는 번호가 다릅니다. 「6번, 7번」 자리에 5단계 뒤에도 틀린 문제 번호를 넣어 치세요. 점수가 떨어졌다면 새로 틀린 문제 번호를 넣습니다. 예전에 「맞았다」던 것이 3단계의 3번처럼 우연이었을 수 있습니다. 틀린 문제가 하나도 없으면 7단계로 넘어가세요.

✅ 이렇게 나오면 성공 — 문제마다 「정답이 맞다/틀리다」와 그 이유가 보이면 됩니다. 이번에는 시험지가 맞았습니다. 시험지가 틀렸다는 답이 나오면 정답을 고치고, 3단계로 돌아가 기준선을 다시 잽니다(전·후 점수는 같은 시험지끼리만 비교해야 합니다). 2단계에서 클로드가 짚은 1번처럼 정답이 둘일 수 있는 문제는 「막히면」 3번입니다.

7단계 · 처음 보는 새 문제로 다시 재기

지금까지의 점수(8/10)는 고칠 때 본 10문제의 점수입니다. 고친 사람이 그 문제들을 이미 알고 있으니, 진짜 실력은 처음 보는 문제로 재야 보입니다.

✅ 이렇게 나오면 성공 — 새 문제 점수(예: 3/5)와 틀린 이유가 보이면 됩니다. 이 편에서는 8/10 이 3/5 로 내려갔습니다. 5문제라 숫자가 크게 흔들리니 「본 문제의 점수보다 낮게 나올 수 있다」는 신호로만 읽으세요. 새 문제를 보고 또 고쳤다면 그 5문제도 이제 「본 문제」입니다. 확인용 새 문제를 다시 만듭니다.

8단계 · 매일 아침 채점하고, 나빠질 때만 알리게 하려면 (예시 답)

마지막으로 이 채점을 매일 아침 저절로 돌리고, 점수가 나빠질 때만 알리려면 어떻게 하는지 물어만 봅니다. 예약을 실제로 거는 것은 12편, 폰으로 알림을 받는 것은 11편입니다. 이 편에서는 예약을 걸지 않았습니다.

✅ 이렇게 나오면 성공 — 방법이 「예약」과 「지난 점수와 비교」 두 부분으로 나뉘고, 무엇과 견줄지(전날 점수 / 최고점) 정하라는 말이 나오면 됩니다. 이 말이 없으면 「전날 점수와 견줄까, 최고점과 견줄까?」라고 물어보세요. 전날 점수와 견주면 「새로 떨어진 날」에만 울려서, 며칠째 떨어져 있는 것이 숨습니다(아래 「내가 만들 때는」에서 제가 겪은 일).

어디에 예약을 걸지도 알아 두세요. 이 편에서 클로드는 윈도 「작업 스케줄러」를 권했습니다(맥이면 다른 방법이 나옵니다). 12편의 본길은 클로드 데스크톱 앱의 로컬 예약이고, 작업 스케줄러·맥 launchd 는 12편 「다른 길」에 있습니다. 어느 쪽이든 내 PC 에서 도는 예약이어야 이 폴더의 파일을 봅니다. 클라우드 루틴(/schedule)은 내 PC 파일을 못 본다고 클로드도 짚었습니다. 클로드가 「설정해 드릴까요?」라고 물으면, 예약이 실제로 걸리는 일이니 12편 순서를 확인한 뒤에 시키세요. 시험지가 둘 이상이면 시험지별로 따로 비교해야 합니다(8/10 과 3/5 를 섞어 비교하면 떨어진 것처럼 잘못 알립니다. 제가 같은 질문을 다시 물었을 때 클로드가 먼저 짚었습니다).

다 됐습니다 — 이제 이렇게 말하면 됩니다

항상 이 폴더에서 클로드를 열고 이야기합니다.

  • 「검색을 고치고 전후 점수를 비교해 줘. 시험지는 건드리지 말고.」
  • 「지금 점수 재 줘. 틀린 문제는 검색이 1~3위로 낸 글과 같이 보여 줘.」
  • 「이 시험지 정답이 정말 맞는지 글을 읽고 확인해 줘.」
  • 「새 문제 5개를 더 만들어서 지금 검색을 재 줘. 앞의 10문제와는 다른 말투로.」
  • 「검색을 고칠 때마다 이렇게 하라고 CLAUDE.md 에 적어 줘.」 (규칙 파일은 15편과 같습니다. 아래 「한 번에 맡기기」의 규칙 여섯 줄을 쓰면 됩니다. 파일 이름이 다르면 내 것으로 바꿔서.)

막히면

  1. 시험지를 만들면서 검색까지 돌려 버리거나, 채점까지 한꺼번에 해 버린다 → 첫 시험에서 그랬습니다. 2단계 말에 「채점은 아직 하지 마」가 없었더니 시험지를 만들면서 검색을 돌려 점수까지 말했습니다. 이렇게 다시 말하세요: "시험지만 만들고 검색은 아직 돌리지 마. 채점은 내가 말할 때 해 줘." 검색 결과를 본 뒤에 정답을 정했다면: "문제와 정답은 글만 읽고 다시 만들어 줘."
  2. 점수가 올랐는데 믿기 어렵다 → 시험지를 건드려서 올랐거나, 그 문제들에만 맞게 고쳤을 수 있습니다. 이렇게 말하세요: "시험지 파일은 고치지 않았지? 고친 곳이 있으면 어디인지 말해 줘." 그리고 7단계처럼 처음 보는 새 문제로 다시 재세요.
  3. 정답이 둘일 수 있는 문제가 있다(2단계의 1번처럼) → 이렇게 말하세요(번호는 내 시험지의 것으로): "1번은 정답이 둘이야. 시험지에 정답을 여러 개 적을 수 있게 하고 다시 채점해 줘." 해 보니 클로드가 1번 정답을 두 글로 바꾸고 채점 규칙도 고쳤고, 이 편에서는 점수가 그대로(8/10)였습니다. 검색이 둘 중 하나를 1등으로 내도 맞다고 세게 된 것입니다.
  4. 채점 파일을 만들면서 search.js 를 고쳤다고 한다 → 제 시험에서는 두 번 다 그랬습니다. 채점 파일이 검색 파일을 불러 쓸 수 있게 손본 것이고 쓰는 방법과 결과는 그대로라고 했습니다. 그래도 점수를 재는 쪽이 재는 대상을 바꾸면 안 되니, 이렇게 확인하세요: "search.js 에서 고친 곳이 정확히 어디인지 보여 줘. 검색 결과가 달라지지 않았는지도 확인해 줘."
  5. 매일 돌려도 점수가 늘 같다 / 알림이 안 온다 → 같은 글·같은 검색·같은 시험지로는 매일 같은 점수가 나옵니다. 알림이 없는 것은 「나빠지지 않았다」일 수 있습니다. 다만 채점이 아예 못 돈 날(파일이 없거나 시험지를 못 읽은 날)도 알림이 없으면 구별이 안 됩니다. 이렇게 말해 두세요: "채점이 못 돌았거나 시험지를 못 읽은 날은 점수 하락이 아니라 '채점 못 함'으로 따로 알려 줘." (이 말은 제가 이 편에서 시험해 보지는 않았습니다. 제작 기록실의 밤 채점에서 같은 구분을 둔 경험으로 적었습니다.)

한 번에 맡기기 (익숙해진 다음에)

긴 프롬프트 펼치기 — 위 2\~4단계와 규칙을 한 번에 시키는 말

내 검색(또는 자동 답변)이 이미 폴더에 있을 때, 시험지·채점 파일·첫 점수·규칙 파일을 한 번에 시킵니다. 폴더에서 클로드를 연 뒤 붙여 넣으세요. 꺾쇠 <…> 칸은 내 것으로 바꿔 넣습니다. 5~8단계(고치기·시험지 의심·새 문제·예약)는 규칙이 들어간 뒤 따로 말합니다. 가짜 자료 폴더에서 이 말을 실제로 돌려 (가)~(마)가 모두 통과로 나오는 것을 확인했습니다.

역할: 너는 내 PC 에서 일하는 도우미다. 내가 만든 검색(또는 자동 답변)이 잘 되는지 점수로 재는 시험지와 채점 파일을 만들고, 앞으로 내가 검색을 고칠 때마다 전·후 점수를 말하게 만든다. 나는 초보자이니 어려운 말은 풀어서, 한 단계씩 말해 줘.

맥락: 지금 열려 있는 이 폴더에 재 볼 것이 있다. 시험지는 문제(질문)와 정답(그 질문에 맞는 글 이름)이 든 목록이고, 점수는 채점 파일이 시험지대로 돌려서 센 값만 말한다. 눈으로 세거나 어림하지 않는다. 시험지를 만들 때는 검색을 미리 돌려 보지 않는다(검색이 잘 찾는 문제만 남기지 않으려고). 정답이 둘일 수 있는 문제는 정답을 여러 개 적을 수 있게 한다. 아무것도 새로 설치하지 않고 Node.js 만 쓴다.

입력: <운영체제>, <재 볼 것: 예 faq 폴더의 글을 낱말로 찾는 search.js>, <문제 수: 예 10>

작업:
① 확인 — 아무것도 만들기 전에 먼저 본다.
 - 지금 폴더의 전체 경로와 재 볼 것의 파일 이름을 내게 보여 준다.
 - node --version 을 실행해 보여 준다.
 - testset.json, grade.js, scores.log, CLAUDE.md 중 하나라도 이미 있으면 덮어쓰지 말고 멈춰서 어떻게 할지 묻는다.
② 시험지 — testset.json 을 만든다. 문제 <문제 수>개, 문제마다 정답 글 이름. 글을 읽고 만들되 검색은 아직 돌리지 않는다. 글 제목의 낱말을 그대로 쓴 쉬운 문제와, 손님이 실제로 칠 법한 다른 말로 바꾼 문제를 섞는다. 정답이 둘일 수 있는 문제는 정답을 여러 개 적고, 어느 문제가 그런지 알려 준다.
③ 채점 — grade.js 를 만든다. 시험지의 문제를 재 볼 것에 넣어 정답이 1등이면 맞은 것으로 센다(1등이 여럿이면 그 글들이 모두 정답일 때만). 점수(맞은 수/전체)를 화면에 보이고, scores.log 에 날짜·점수·시험지 이름을 한 줄 덧붙인다. 재 볼 것을 고쳐야 하면 쓰는 방법이 바뀌지 않게 하고, 고친 곳을 알려 준다.
④ 첫 점수 — node grade.js 를 돌려 점수를 알려 준다. 그리고 틀린 문제만 골라 문제·정답·검색이 1~3위로 낸 글을 보여 준다. 틀린 이유는 짐작이면 짐작이라고 말한다.
⑤ 규칙 — 이 폴더의 CLAUDE.md 를 새로 만들어 아래 「CLAUDE.md 시작」과 「CLAUDE.md 끝」 사이의 내용 그대로 적는다(한 글자도 바꾸지 말 것).

=== CLAUDE.md 시작 ===
# 점수 규칙

- 이 폴더의 검색은 testset.json 의 시험지와 grade.js 로 잰다. 「좋아졌다」고만 말하지 않고 점수로 말한다.
- 검색을 고치기 전에 node grade.js 로 점수를 먼저 재고, 고친 뒤 다시 재서 전·후 점수와 새로 틀린 문제를 알려 준다.
- 시험지(testset.json)와 정답은 내가 말하기 전에는 바꾸지 않는다. 점수를 올리려고 정답을 고치지 않는다.
- 점수가 떨어지거나 오르지 않으면, 고치기 전에 틀린 문제의 정답이 정말 맞는지 글을 읽고 먼저 확인해서 알려 준다.
- 고친 뒤에는 고칠 때 보지 않은 새 문제로도 한 번 재 본다.
- 시험지가 둘 이상이면 시험지별로 따로 비교한다.
=== CLAUDE.md 끝 ===

⑥ 마무리 — 초보자 눈높이로 무엇이 만들어졌고 앞으로 어떻게 말하면 되는지(예: "검색을 고치고 전후 점수를 비교해 줘") 설명한다. 매일 저절로 채점하는 예약은 만들지 말고, 하고 싶으면 따로 말하라고 안내한다.

제약: 비밀키·토큰·비밀번호·개인정보를 출력하거나 파일에 쓰지 않기. 오류를 건너뛰지 않기. 기존 파일을 지우거나 덮어쓰지 않기. 이 폴더 밖의 파일을 읽지도 쓰지도 않기. 아무것도 설치하지 않기. 예약이나 알림은 만들지 않기.

출력: 한 일, 확인된 상태(폴더·Node.js 버전), 만든 파일 목록, 첫 점수와 틀린 문제, 검증 결과((가)~(마) 각각 통과/실패), 남은 문제와 다음 조치.

검증: 아래를 파일을 다시 열어서 전부 확인해야 "자동 확인 통과"라고 보고한다. 하나라도 실패하면 완료로 보고하지 말 것.
 (가) 이 폴더에 testset.json, grade.js, scores.log, CLAUDE.md 가 있다.
 (나) testset.json 의 문제 수가 <문제 수>개이고, 문제마다 정답이 있고, 정답 글 파일이 실제로 폴더에 있다.
 (다) node grade.js 를 한 번 더 돌리면 같은 점수가 나오고 scores.log 에 줄이 하나 늘어난다.
 (라) 재 볼 것의 파일 내용이 ③에서 말한 것 말고는 바뀌지 않았다.
 (마) CLAUDE.md 가 위 「CLAUDE.md 시작」과 「CLAUDE.md 끝」 사이의 내용과 같다.

내가 만들 때는

처음엔 이렇게 시켰습니다. 2026-09-23 05:07, 회사 자료를 찾아 답하는 AI(파이스)를 고치던 때였습니다. 전날(9/22) 하루에, 사용자 눈에는 「AI 가 좀 멍청해졌다」로만 보이고 오류도 경고도 한 줄 안 난 고장을 넷 찾았습니다. 클로드가 「다음에 할 일」 맨 앞에 「밤마다 채점」을 놓았고(「매일 재는 자가 없으면 또 모르고 지나갑니다」), 저는 이렇게 한 줄로 답했습니다. 「밤마다 채점하는거 만들자」 네 시간쯤 뒤(09:11)에는 이렇게 덧붙였습니다. 「채점 문항 늘리자」 그날 채점은 10문항에서 21문항이 됐고, 새벽 4시 40분에 맥이 저절로 돌립니다. 돌려 본 첫날 두 문항이 실패했는데, 둘 다 고장이 아니라 시험지(문항) 쪽 잘못이었습니다. 밤 채점도 시작하자마자 자가 먼저 틀린 셈입니다. 이 편의 6단계가 그래서 있습니다.

검색을 고칠 때는 시험지부터 만들었습니다. 2026-10-02 23:23 에 이렇게 말했습니다. 「ㅇㅋ 그 나눔으로 지금 3단계 전부 실시해..」 그 3단계가 검색 정확도를 고치는 일이었고, 고치기 전에 시험지 52항목(규격 22 · 파일 15 · 표 15)을 만들었습니다. 정답은 맥에서 직접 센 값입니다. 클로드는 그날 일을 나누면서, 채점 프로그램은 가벼운 모델에게 맡기더라도 문항과 정답은 맥의 실제 색인을 보고 자기가 직접 정하겠다고 했습니다. 「정답지가 틀리면 그 뒤 측정이 전부 틀립니다」라는 이유였습니다. 한국어→영어 낱말 사전(203항목)을 만든 쪽에는 시험지를 보여 주지 않았습니다. 시험지에 맞춘 사전은 점수만 오르기 때문입니다. 이 편의 5단계에서 클로드가 시키지도 않았는데 같은 방법을 쓴 것이 반가웠습니다. 그 전에, 9/20 에 문서 검색을 고칠 때도 17문제짜리 시험지로 1등이 14개에서 17개가 됐습니다.

그런데 시험지가 틀린 적이 다섯 번입니다. 정답을 한 곳으로만 적었는데 맞는 답이 여럿이었던 일(「막히면」 3번), 글 앞의 다른 조항 언급까지 정답으로 센 일 같은 것입니다. 뒤의 일은 22문제에서 1등이 14개로 보였던 것이 바로잡고 보니 10개였습니다. 점수가 떨어졌을 때 순위 숫자만 보면 고친 것이 나빠 보입니다. 먼저 「예전 정답」의 본문을 열어 보니 가짜였습니다. 올랐을 때도 같이 봅니다.

알림에서도 배웠습니다. 매일 울리면 아무도 안 봐서 「새로 틀린 것에만 한 번」 보내게 했는데, 카드 요약(회사 파일 목록에 요약을 채우는 밤 작업)이 9/29 부터 닷새 밤을 매일 떨어져 있어도 폰은 한 번 울렸거나 아예 안 울렸습니다. 며칠째 같은 실패는 보고서를 거슬러 읽어야 보였습니다. 그래서 이 편의 8단계에는 「무엇과 견줄지」를 적었습니다. 또 그날 읽기 한도(데이터베이스가 하루에 받아 주는 읽기 횟수)에 걸려 못 잰 날은 실패가 아니라 「건너뜀」으로 세게 했습니다(「막히면」 5번).

→ 뒷이야기 15단계에서 시험지와 헛점수를, 17단계 7번에서 조용히 죽어 있던 고장 넷을, 따라 하기 12편에서 예약 거는 법을, 11편에서 폰 알림을 보세요.