카카오 계정과 연동하여 게시글에 달린
댓글 알람, 소식등을 빠르게 받아보세요

가장 핫한 댓글은?

가상인구로 제품 수요 사전검증 (NVIDIA 합성 페르소나 + Claude Code, 실측 $0.41)Threads 아이디어를 직접 재구현하고 비용까지 공개 검증했습니다 (NVI

2026.09.06

0

계기
Threads에서 Dongkyu Lee(@dominic_kyu)님이 올린 게시물을 봤습니다. "제품 아이디어가 생기면 설문 대신 가상 인구한테 물어본다 — NVIDIA가 공개한 한국인 100만 명 합성 페르소나에 제품을 대입해서 누가 쓰고/왜 안 쓰고/누가 돈을 내는지를 AI가 국가별로 분석한다"는 내용이었습니다.

원문에 있던 저장소 링크는 이미지에서 잘려 있었고, 여러 번 검색해도 원본 코드를 찾지도 열어보지도 못했습니다. (참고: 이건 NVIDIA가 뭔가를 철회했다는 뜻이 아닙니다 — Nemotron-Personas 데이터셋 자체는 지금도 공개·CC BY 4.0 상태이고, 단순히 원 게시물이 올라온 지 얼마 안 돼 검색엔진에 아직 안 잡혔을 가능성이 훨씬 큽니다.) 그래서 게시물 두 개에 서술된 메커니즘 설명만 근거로 코드를 처음부터 새로 짰습니다 — 원본과 한 줄도 대조해본 적이 없습니다.

메커니즘 요약
원 게시물이 설명한 원리를 그대로 구현했습니다.

배치 판정: 페르소나 1명당 LLM을 1번 부르면 파산하니, claude -p 1회 호출로 25명을 한꺼번에 판정합니다(--json-schema로 정확히 그 배치 크기만큼 판정을 같은 순서로 강제 반환). 시스템 프롬프트로 "같은 배치 내 페르소나끼리 서로 영향받지 말 것"을 명시.
여론 요약, 대화 아님: 노드끼리 대화시키는 대신, 1차 판정 결과를 퍼센트/Counter/중앙값으로 순수 집계한 "공론 요약" 텍스트만 만들어 2차 판정 프롬프트에 넣습니다. 페르소나 수가 늘어도 비용이 O(N²)가 아니라 O(N)으로 유지됩니다.
서버 없음: Flask/FastAPI 없이, Python 스크립트가 로컬 JSONL을 읽고 claude CLI를 서브프로세스로 부르는 게 전부입니다.
테스트 대상은 IDEAINNOV — 연구 아이디어를 지배방정식(PDE) 도출·검증을 거쳐 논문 초안으로 자동 변환하는 저희 프로젝트입니다. 이 하네스 자체가 이번 글의 주제이고, IDEAINNOV는 "실제로 뭔가에 대입해봐야 하네시가 진짜 도는지 알 수 있다"는 이유로 고른 테스트 케이스입니다.

1차 실험(일반 인구) 결과 — 정직하게 먼저 공개
NVIDIA nvidia/Nemotron-Personas-Korea 데이터셋(CC BY 4.0, 100만 행)에서 실제로 뽑은 무작위 한국 성인 25명에게 물었습니다.

사용 의향(would_use): yes 0% / maybe 4.0% / no 96.0%
user_type: not_applicable 96.0% / adjacent 4.0%
유일한 adjacent는 53세 IT 대학원졸 연구원(엔지니어) — 그런데도 "core_target"이 아니라 "adjacent"로 정확히 구분했습니다. 사유: "업무는 IT 하드웨어 신뢰성 검증이라 IDEAINNOV가 다루는 유체/재료/에너지/열/우주/경제 PDE 도메인과 결이 다르다"는, 학력만 보고 뭉뚱그리지 않은 구체적 판단이었습니다.
대학원졸 치과의사도 학력은 높지만 "임상 진료 중심이라 PDE 논문 자동화와 무관"으로 정확히 no 처리됨.
1차 → 2차(전체 공론 요약 노출 후 재판정)에서 판정이 바뀐 사람: 0/25 (0%).
이 결과는 "만들어도 소용없다"가 아니라, 일반 인구 무작위 표본이 애초에 니치 B2B 연구 도구를 검증하기에 맞지 않는 표본이라는 뜻입니다. 100만 명 중 "공학/재료/에너지 분야 대학원급 연구자" 비율은 아마 1% 미만일 테니, 무작위 25명 중 core_target 0명은 오히려 하네스가 올바르게 작동한다는 신호입니다.

반전 — 그럼 진짜 타깃은?
후속으로 코어 세그먼트 17명을 다시 돌렸습니다. 두 종류를 한 배치에 섞되 source 필드로 구분했습니다.

real_dataset 12명: 실제 데이터셋에서 "직업/전공이 엔지니어링·기술직에 가까운" 사람만 스캔해서 찾은 진짜 행(용접공, 정보보안전문가, 플랜트기술자, 토목기술사 등).
illustrative_construction 5명: IDEAINNOV가 명시한 도메인(유체·재료·에너지·항공우주·경제)에 정확히 맞춰 저희가 직접 구성한 "이상적 유저" 페르소나입니다. 데이터셋 행이 아닙니다.
결과: real_dataset 12명은 전원(12/12) not_applicable. illustrative_construction 5명은 전원(5/5) core_target + would_pay=yes.

먼저 인정할 부분: "우리 제품에 정확히 맞게 설계한 가상의 이상적 유저 5명이 전원 좋다고 했다"는 어떤 의미에선 동어반복적인 결과입니다. 코드까지 열어볼 이 커뮤니티라면 5분 안에 이 구조를 알아챌 거라, 숨기지 않고 먼저 말씀드립니다. 그래도 "직업이 엔지니어"인 것만으로는 부족했고(그 12명 전원 not_applicable), "실제로 학위논문/SCI 논문을 써야 하는 사람"이어야 core_target으로 잡혔다는 대비 자체는 실제 데이터 기반 결과입니다. 진짜 가치는 이 5명이 왜 그렇게 반응했는지의 구체적인 내용에 있습니다.

진짜 인사이트
| 소재 | 내용 |
일반 인구 대비 | 무작위 성인 25명 중 사용 의향 0%, 96% "무관"
"직함만으론 안 속음" | 유일한 관심층(adjacent, 53세 IT 대학원졸 연구원)조차 "IT 하드웨어 신뢰성 검증이 주업무라 PDE 물리/재료/에너지 연구와 결이 다르다"고 스스로 선을 그음
"직업이 엔지니어"만으론 부족 | 실제 데이터셋 엔지니어/기술직 12명 — 전원 not_applicable
이상적 타깃 5명 | 재료공학 박사과정 · 배터리 기업 선임연구원 · 유체역학 부교수 · 항공우주연구원 · 계산경제학 박사과정 — 전원 core_target + 결제 의향 yes
대학원생의 반대 이유 | "지도교수 연구비 지원 없이는 구독 지속이 부담" — 월 25,000~30,000원선
기업·정부연구소의 반대 이유 | "연구 데이터를 외부 AI 서버에 올리는 것에 대한 보안·특허 유출 우려" — 월 50,000~130,000원까지도 지불 의향은 있음
교수의 반대 이유 | "AI가 쓴 논문 초안의 학술적 신뢰성·인용 정확성을 누가 검증하나" — 월 120,000원 지불 의향
지불의향 중앙값(코어 세그먼트) | 1차 ₩50,000 / 2차(공론 노출 후) ₩45,000

가격 데이터가 흥미로운 지점: 대학원생조차 월 2.5~3만 원(IDEAINNOV Basic $19 요금제와 거의 일치)을 부담 가능선으로 언급했고, 교수·기업 연구원은 월 12만 원대(Enterprise $99 근처)까지 지불 의향을 보였습니다 — "가격이 문제"가 아니라 "예산·보안 승인 프로세스가 문제"에 가깝다는 뜻입니다.

비용 총정리
이론상 되겠다에서 멈추지 않고, 실제 claude CLI(Claude Code 2.1.251)를 서브프로세스로 두 차례 실제로 돌렸습니다. 호출 1건 단위 로그를 그대로 공개합니다.

| 실행 | 라운드 | 표본 | 비용 | 소요시간 |
| 실행 1 (일반 인구) | 1차 판정 | 25명, 1콜 | $0.1092 | 66.5s |
| 실행 1 (일반 인구) | 2차 판정 | 25명, 1콜 | $0.1090 | 57.4s |
| 실행 2 (코어 세그먼트) | 1차 판정 | 17명, 1콜 | $0.0987 | 69.0s |
| 실행 2 (코어 세그먼트) | 2차 판정 | 17명, 1콜 | $0.0945 | 57.1s |
| 합계 | 호출 4건 | 42명(중복 제외 실제 42명 분) | $0.4115 | 250s |

실행 1 소계 $0.2183, 실행 2 소계 $0.1932. 로그 원본(run.log, round1_batch_00.json, round2_batch_00.json)은 저장소 results/kr_real_run/, results/kr_core_segment_run/에 그대로 있습니다.

CTA
저장소를 통째로 공개합니다 — 데이터, 프롬프트, 하네스 코드, 실행 로그, 이 홍보 전략 문서까지 전부. --dry-run 플래그로 무료로 파이프라인만 먼저 검증할 수 있고, 여러분의 제품 스펙(product/*.json)만 바꿔서 그대로 fork해 돌려보실 수 있습니다.

저장소: https://github.com/taejunjo816/ideainnov-persona-harness
테스트 대상 예시로 쓴 제품: https://ideainnov.com/?utm_source=geeknews&utm_medium=social&u…
고지문

위 결과는 AI 시뮬레이션 결과이며 실제 설문/인터뷰가 아닙니다. 코어 세그먼트의 이상적 페르소나 5명(재료공학 박사과정·배터리 선임연구원·유체역학 부교수·항공우주연구원·계산경제학 박사과정)은 실제 데이터셋 행이 아니라 저희가 직접 구성했습니다. 페르소나 데이터 출처: NVIDIA Nemotron-Personas-Korea (CC BY 4.0).

카카오 계정과 연동하여 게시글에 달린
댓글 알람, 소식등을 빠르게 받아보세요

게시판 목록으로 돌아가기

🔥 시선집중 핫한 인기글

최근 댓글이 많이 달린 글

UNIST 반도체 소재·부품 대학원 2027학년도 전기 2차 신입생 모집 (10/6 10:00~10/15 18:00)

자세히 보기

UST 2027학년도 전기 1차 신입생 모집

자세히 보기

확인