카카오 계정과 연동하여 게시글에 달린
댓글 알람, 소식등을 빠르게 받아보세요

가장 핫한 댓글은?

광고 문구를 유전 알고리즘으로 진화시켰더니 점수는 오르고 신뢰도는 떨어졌다. ideainnov.com의 고개반응 최적화에 실험에 보았습니다.

2026.09.08

1

https://github.com/taejunjo816/ideainnov-persona-harness


NVIDIA Nemotron-Personas-Korea 데이터셋(100만 행, CC BY 4.0)의 합성 페르소나에게
제품과 광고 문구를 판정시키는 하네스입니다. Claude Code CLI를 서브프로세스로
호출하고 로컬 JSONL만 읽습니다. 서버가 없습니다.

ideainnov.com의 고개반응 최적화에 실험에 보았습니다.

핵심은 비용 구조입니다. 원 아이디어는 페르소나끼리 대화시키는 방식인데,
그러면 호출이 O(N제곱)으로 늘어납니다. 대신 1차 판정을 재호출 없이 집계해
여론 요약으로 만들고 2차 프롬프트에 넣었습니다. O(N)이 됩니다.
1회 호출로 25명을 판정하고 --json-schema로 순서를 강제합니다.

확장으로 광고 문구 최적화기를 붙였습니다. 사람이 쓴 시드 문구 8개를 25명에게
판정시켜 점수를 매기고, 상위 3개를 남겨 하위권의 걸림돌을 재료로 자식 5개를
만들어 다음 세대로 넘깁니다. 점수는 100*P(클릭) + 40*P(아마도) + 8*평균신뢰도.

5세대 실행 결과(76콜, 실비용 26.45달러):

세대 한국어 최고 영어 최고
0 37.76 37.12
1 55.68 35.20
2 49.44 38.88
3 68.00 40.32
4 72.16 43.84

여기까지가 자랑이고, 아래가 실제로 배운 것입니다.

1. 점수 함수가 무엇을 최적화하는지 봐야 합니다. 영어는 점수가 올랐는데 평균
신뢰도는 3.44에서 2.48로 떨어졌습니다. 클릭 의향에 100과 40을 주고 신뢰도에
8만 주면, 신뢰를 잃어도 관심만 끌면 점수가 오릅니다. 가중치를 바꾸면 다른
문구가 이깁니다. 진화 알고리즘은 시킨 것을 정확히 합니다.

2. 재판정 노이즈가 최대 7.84점입니다. 같은 문구를 다시 채점해도 이만큼 흔들립니다.
세대 간 차이가 이보다 작으면 개선이 아닙니다. 영어의 37.12에서 43.84는
노이즈 범위 안입니다. 한국어의 37.76에서 72.16만 의미가 있습니다.

3. 두 언어가 서로 다른 제품으로 갈라졌습니다. 한국어는 문서 변환으로, 영어는
사업제안서로 수렴했습니다. 미국 표본은 한글 파일 깨짐 문제를 자기 일과
무관하다고 판단했습니다. 한글 형식 문제가 한국 고유라는 해석과 맞습니다.

제품 검증 쪽 결과도 정직하게 적었습니다. 무작위 25명의 사용 의향은 0%입니다.
오작동이 아니라 100만 행 중 대학원급 공학 연구자가 1%에 훨씬 못 미치기 때문입니다.
장벽은 가격이 아니라 지도교수 연구비 의존, 연구데이터 외부 업로드의 보안 우려,
AI 초안 인용 검증 책임이었습니다. 여론 요약을 본 2차에서 지불 의향 중앙값은
5만원에서 4만 5천원으로 내려갔습니다.

한계도 README에 적었습니다. 25명이 한 컨텍스트를 공유해 교차 오염 위험이 있고,
표본이 무작위가 아니라 필터를 거쳤고, 무엇보다 이 점수는 시뮬레이션 클릭 의향이지
실제 클릭률이 아닙니다. A/B 테스트의 대체물이 아닙니다.

원 아이디어는 Dongkyu Lee(@dominic_kyu)님의 Threads 게시물입니다. 원 저장소
링크가 잘려 원본 코드를 보지 못한 채 설명만 보고 새로 짰습니다. 한 줄도 대조한
적 없습니다.

드라이런은 무료이고, 실제 실행은 --max-budget-usd로 상한을 걸 수 있습니다.
첫 유료 호출 전에 비용을 투사하고 넘으면 시작하지 않습니다.

카카오 계정과 연동하여 게시글에 달린
댓글 알람, 소식등을 빠르게 받아보세요

게시판 목록으로 돌아가기

🔥 시선집중 핫한 인기글

최근 댓글이 많이 달린 글

GIST 기술경영전문대학원 2027학년도 봄학기 신입생 모집 (10/12~10/21)

자세히 보기

2027학년도 전기 KU-KIST융합대학원 입학설명회

자세히 보기

확인