미국 공인회계사 한 명이 가상 PC 바탕화면 앞에 앉아요. 회사 작업 파일을 뒤져 숫자를 찾고, 12월 월말 결산표를 채우는 과제예요.
제한시간은 3시간이에요. 일찍 끝내도 3시간치 수당이 나와서, 시간을 끌 이유는 없었어요.
이런 회계사 12명이 과제 네 개를 풀었어요. 둘은 혼자, 둘은 AI를 옆에 두고요. AI 학습 데이터 회사 머코어가 공개한 실험 결과예요.
연구진이 오해받을까 봐 공개를 망설인 결과
혼자 푼 쪽부터 볼게요. 평균 경력 5.4년인 회계사들은 채점 항목을 평균 37%쯤 채웠는데요, 한 과제에 대부분 30분에서 180분이 걸렸어요.
앤트로픽의 클로드 오퍼스 5는 같은 과제를 스무 번 풀어 스무 번 다 만점이었어요. 한 번에 10분도 안 걸렸죠.
채점 항목 한 칸을 맞히는 데 든 돈도 쟀어요. AI는 0.21달러, 회계사는 미국 회계사 중간 임금으로 10.35달러예요. 49배 차이인데, AI 쪽은 캐싱 할인 없이 정가로 잡은 최대치예요.
결과가 하도 세서, 연구진은 오해받을까 봐 공개를 안 할 생각까지 했대요.
정답은 한때 화면에 있었어요
원래 이 실험이 재려던 건 따로 있었어요. 회계사가 AI를 쓰면 얼마나 더 잘하나, 이거였죠.
그런데 AI와 같이 푼 24번은 AI 혼자 푼 쪽보다 약 15배 오래 걸렸어요. 정확도도 조금 낮았고요. 24번 중 4번이 만점을 놓쳤거든요.
그 4번 중 3번은 AI가 한때 정답을 냈던 판이었어요. 2번은 AI가 스스로 답을 고쳤고, 회계사가 고친 답을 따랐어요. 나머지 1번은 회계사가 AI의 첫 정답을 뒤집었어요.
물론 조건이 붙는데요. AI 혼자 이미 만점이라, 사람이 더 보탤 점수가 채점표에 남아 있지 않았어요. 과제는 원래 AI를 떨어뜨리려고 함정을 촘촘히 심은 것이었고, 동료에게 물어볼 수도 없었고요.
한 회계사는 AI랑 푼 과제가 3시간보다 한참 일찍 끝나서 "덜 한 것 같았다"고 적었어요. 일이 빨리 끝나서 불안하다니, 회계사다운 고민이에요.
AI 답을 원본 데이터와 맞춰보는 일이 제일 어려웠대요
과제에 심은 함정은 이런 식이에요. 12월 말 투숙분이 1월 3일에야 청구돼 12월 매출에서 빠진 것, 주차 수입 4,000달러가 객실 매출로 잘못 들어간 것.
출제자 말로는 드문 실수가 아니래요. 계정을 잘못 탄 매출, 월을 넘겨 도착한 청구서, 장부에 안 들어간 수수료는 평범한 결산에서 늘 보는 거라고요.
내 스마트스토어 월말 정산으로 치면 12월 31일 주문이 1월 정산서에 찍히는 칸, 배송비가 상품 매출에 섞여 들어간 칸 같은 거죠.
AI와 같이 푼 회계사 한 명은 제일 어려웠던 일로 이걸 꼽았어요. AI가 낸 답과 출처를 원본 데이터와 하나씩 맞춰보는 일이요.
앞에서 본 세 판도 정답이 중간에 바뀐 판이었죠. 그러니 다음 정산 검수 때 볼 곳은 넓지 않아요.
AI가 앞서 낸 숫자를 스스로 고치는 줄, 아니면 내가 AI 숫자를 고쳐 쓰려는 순간이요. 바뀌기 전 숫자와 바뀐 숫자를 나란히 두고 원본 칸 하나만 열어보면 돼요!
— 점 그래프 마흔네 개를 손가락으로 하나씩 세어 본 한눈