AI

문의 61%를 갈랐는데, 답장은 못 쓰는 AI

한이룸 · 2026.09.24 · 읽는 시간 4

문의 100건을 AI 네 개에 똑같이 던진 시험이 있었어요. 답장을 쓰라는 게 아니라, CS 문의 자동 분류만 시킨 시험이었죠.

질문은 네 개였어요. 어느 팀이 받을 건지, 급한 건지, 환불을 달라는 건지, 말투가 험한지.

셋은 익숙한 이름이었습니다. 클로드 소넷 5, GPT-5.6 솔, 제미나이 3.8 플래시. 나머지 하나는 문장을 한 줄도 못 쓰는 모델이었고요.

계산서는 이렇게 나왔어요. 클로드가 100건에 0.199달러, 말 못 하는 쪽이 0.0031달러. 우리 돈 4원 남짓이죠.

이 값이면 아침 9시 문의함 풍경이 달라져요. 답장 칸은 아직 비어 있어도, 100통 옆에 '결제팀'·'급함'·'환불 요청' 이름표는 이미 붙어 있는 거예요.

인사도 못 하는 신입이 들어왔어요

이 모델 이름은 제브(Jev)예요. 미국 스타트업 타입세이프가 얼리 액세스(대기 명단 순서대로 문을 열어주는 방식)로 내놓았죠.

만든 사람은 오픈AI에서 챗GPT의 지시 따르기 연구를 하던 디오구 알메이다예요. 출시 글에 이런 질문을 적었더라고요. "모델은 몇 년째 대화에선 사람을 넘어섰는데, 그 많은 자동화는 다 어디 있나요?"

그래서 제브는 대화를 버렸습니다. 질문과 보기를 주면 하나를 고르고, 거기에 확률을 붙여 돌려줍니다.

더레지스터가 든 예시가 딱 이 모양이에요. 고객 문의 하나를 넣으면 "기술 85%, 결제 8%, 영업 7%" 같은 답이 확신도 0.82와 함께 나와요.

값도 이 구조를 따라가요. 입력 토큰(AI가 글을 세는 단위) 100만 개에 0.042달러, 출력은 0원이에요. 쓸 말이 없으니 받을 돈도 없는 셈이죠.

고객센터로 치면 인사도, 사과 문자도 못 보내는데 서류 분류는 0.07~0.5초에 끝내는 신입이 들어온 거예요. 회식 자리에선 조용하겠지만 월요일 아침엔 제일 먼저 찾게 될 타입이죠.

200배라던 속도, 남이 재보니 4~7배였어요

타입세이프가 내건 숫자는 '최대 193.6배 빠르고 444.6배 싸다'예요. 회사도 출시 글 각주에 이 숫자가 실제로 얻을 효과 중 높은 쪽일 거라고 달아뒀고요.

앞의 문의 100건 시험은 브릴마크의 아리풀 이슬람이 직접 돌려본 거예요. 결과는 4~7배 빠르고, 31~65배 쌌습니다.

200배엔 한참 못 미치죠. 그래도 7배면 한 시간짜리 분류가 라면 물 끓이고 먹는 사이, 8분 남짓으로 줄어드는 속도예요.

시험자가 가장 오래 들여다본 건 속도표보다 답 옆에 붙은 확률이었어요. 100건 중 47건이 확신도 0.99 이상으로 나왔는데, 47건 모두 다른 세 모델과 답이 같았거든요.

그래서 선을 하나 그었어요. 확신도 0.9 이상은 자동으로 보내고, 그 아래는 사람 책상으로.

결과는 61건 자동, 39건 사람. 자동으로 간 61건은 98.4%가 다른 모델들의 답과 일치했습니다.

물론 이 100건은 시험용으로 만든 문의였고, 시험자 스스로 표본이 작다고 적어뒀어요. 그래도 방향은 선명하죠. 기계가 자신 있는 건 기계가, 헷갈리는 건 사람이 봅니다.

9,081줄 대기열이 13분 만에 비었어요

비슷한 때 개발자 블로그 paddo.dev에 올라온 사례도 같은 모양이에요.

가격 정보 서비스 프리코그니는 소매점 상품 목록과 경쟁 상품을 짝지어 주는 곳이죠. 그중 애매한 짝 9,081줄이 사람 검수를 기다리며 쌓여만 있었대요.

제브에게 '같은 상품이 맞나'만 묻게 했더니 13분 22초 만에 다 돌았어요. 전체 값은 0.32달러, 450원 정도예요.

답은 셋으로 갈렸어요. 아니다 49%, 맞다 21%, 판단 보류 30%.

이 30%가 반가운 숫자예요. 모르는 건 모른다고 빼주니까, 사람은 그 30%만 들여다보면 되거든요.

글쓴이가 50건을 손으로 다시 봤어요. '아니다' 20건은 전부 맞았고, '맞다' 20건 중 애매한 건 2건이었어요. 경쟁사 상품명에서 옵션 꼬리표가 빠진 경우였죠. '보류' 10건 중 8건은 정말 사람이 볼 몫이었고요.

사람이 틀리고 모델이 맞은 건도 하나 나왔습니다. 검수자가 같은 상품으로 넘겼던 짝을 모델은 확률 0.06으로 잘랐는데, 가로 폭이 두 배인 롤이었거든요.

글쓴이의 정리는 이랬어요. "값이 바꾼 건 정확도가 아니라 구조다."

한국어 문의함에 들이기 전에

제브가 못 하는 것부터 짚을게요. 답장은 한 글자도 쓰지 못합니다. 숫자 계산, 날짜 따지기, 사진 보기도 안 되고요.

한국어도 시험이 필요해요. 공식 문서에 영어가 주 학습 언어라 정확도가 가장 높고, 한중일 문자는 처리하지만 같은 수준은 아니라고 적혀 있거든요.

문서는 그래서 내 문의로 먼저 시험하고, 확신도를 보면서 나누라고 권해요. 위의 0.9 선이 한국어 문의함에선 더 높아질 수 있다는 얘기죠.

쓰는 길도 아직은 API(다른 프로그램이 불러 쓰는 창구)예요. 개발을 도와줄 손이 하나 있거나, n8n 같은 노코드 자동화 도구의 HTTP 호출 칸에 이어야 해요.

하지만 이 조건을 다 달고도 계산이 맞는 칸이 있습니다. 채널톡이 정리한 걸 보면 배송 상태 문의는 평소 이커머스 CS의 10~25%, 성수기엔 50~80%까지 올라가요.

"어제 주문한 니트 언제 와요?"는 보기가 정해진 질문이에요. 배송조회 안내로 보낼지, 사람에게 넘길지만 가르면 되죠.

반대로 "사이즈 바꿨는데 또 안 맞아요, 이번엔 환불해 주세요"처럼 날 선 문의는 사람 몫으로 남겨요. 손님 대다수가 결국 사람과 이야기하고 싶어 한다는 조사도 있었으니, 사람 손이 비는 쪽이 오히려 반가운 일이에요.

문의함을 챗봇에 통째로 맡길지 말지, 그 큰 질문은 잠시 내려놔도 돼요. 맡길 건 문의함 전체가 아니라 맨 앞의 분류 한 칸입니다.

그 한 칸을 채점할 한국어 시험지는 이미 문의함에 쌓여 있어요. 지난주 문의 50건을 엑셀에 붙이고 옆 칸에 배송·환불·사이즈·그 외를 손으로 적어두면, 어떤 모델이 와도 쓸 수 있는 채점표가 되죠.

오늘 저녁 50건에 이름표 네 종류만 붙여두면, 다음 달 견적서를 받을 때 계산이 한결 쉬워질 거예요!

— 다혜, 문의함에 이름표 붙이는 중

← 이룸회보 전체 보기