Q. 훨씬 싸고 틀리지 않는다는 새 AI가 나왔다는데, 지금 바꿔야 하나요?
- 질문함
- AI도입
- 모델선택
- 검증
- AI동향
Q. 요즘 「환각이 없고, 기존 AI보다 수십 배 싸고 빠르다」는 새 모델 이야기가 많이 보입니다. 우리 팀도 분류나 판정 같은 반복 업무에 AI를 쓰고 있는데, 지금 이쪽으로 바꿔야 할까요?
질문하신 모델은 아마 9월 15일에 발표된 TypeSafe의 Jev일 겁니다. 결론부터 말씀드리면, 지금은 「바꿀까」보다 「언제, 무엇을 보고 바꿀까」를 정해 둘 때입니다. 좋은 모델인지와 지금 우리가 쓸 수 있는지는 서로 다른 질문이기 때문입니다.
한눈에 보기
핵심좋은 모델인가와, 지금 우리가 쓸 수 있는가는 다른 질문입니다.
소식이 답하는 것과 우리가 답해야 하는 것
- 소식이 답하는 것 빠르다 · 싸다 · 환각 없음
- 도입 전에 볼 것 가입이 열려 있나 · 회사 밖 검증 · 우리말 성능 · 가격 유지
바로 할 일바꾸기 전에, 정답을 아는 우리 업무 사례 20~30건을 시험 문제로 모아 두세요.
어떤 모델인지부터 짧게
Jev는 우리가 흔히 쓰는 AI처럼 문장을 만들어 답하지 않습니다. 미리 정해 둔 선택지 가운데 하나를 고르고, 그 답이 얼마나 확실한지를 함께 돌려주는 모델입니다. 「이 문의는 환불·배송·기타 중 무엇인가」 같은 판정에 맞춰져 있습니다. 회사는 이런 일에서 기존 대형 모델보다 훨씬 빠르고 싸다고 밝혔고, 입력 값은 아주 낮게, 출력 값은 받지 않는다고 발표했습니다(공식 발표).
화제가 될 만합니다. 반복 판정 업무가 많은 팀이라면 특히 그렇습니다. 그래서 더더욱, 소식이 답해 주는 것과 우리가 답해야 하는 것을 나눠 볼 필요가 있습니다.
「환각 없음」은 「판단이 옳다」가 아닙니다
가장 많이 퍼진 문구가 「환각이 없다」입니다. 그런데 회사 발표문을 직접 읽어 보면 이렇게 적혀 있습니다. 그 0%라는 숫자는 측정한 값이 아니라, 답이 늘 정해진 선택지 안에서만 나오도록 형식이 보장되니 0%로 표시했다는 것입니다.
말이 안 되는 이야기는 아닙니다. 선택지 밖의 엉뚱한 답이 나올 수 없으니, 문장을 지어내는 식의 실수는 없습니다. 하지만 고른 선택지가 틀릴 수는 있습니다. 「환불」 문의를 「배송」으로 고르는 실수는 형식상 아무 문제가 없는 답입니다. 국내 기사에 실린 개발자 반응도 같은 지점을 짚었습니다. 답의 형식이 안전한 것과 판단이 맞는 것은 별개라는 것입니다(AI타임스).
오히려 틀린 답이 형식상 멀쩡해 보이니, 틀렸는지 알아채기가 더 어려울 수 있습니다. 문장형 AI는 이상한 소리를 하면 읽다가 걸리기라도 합니다.
네 가지를 보고 시점을 정합니다
도입을 판단할 때는 발표 자료가 아니라 아래 네 가지를 봅니다. 9월 26일 기준으로 확인한 상태를 같이 적었습니다.
| 볼 것 | 왜 보나 | 9월 26일 기준 |
|---|---|---|
| 지금 쓸 수 있나 | 발표와 실제 사용 가능은 다르다 | 9월 20일 가입이 모두에게 열렸다가, 9월 22일 수요 급증으로 신규 가입을 일시 중단 (회사 공지). 10월 3일 덧붙임: 9월 27일 공동창업자가 개인 X 계정에서 신규 가입 재개를 밝힘. 다만 신규 가입자 무료 크레딧은 일시 중단 (게시글) |
| 회사 밖 검증이 있나 | 회사 평가는 회사 팀이 만들었다 | 개인·커뮤니티 평가가 나오기 시작. 중간 가격대 AI와 비슷한 정확도, 선택지 이름을 어떻게 붙이느냐에 따라 답이 크게 바뀐다는 지적 (종합 정리) |
| 우리 말로 되나 | 성능은 언어마다 다르다 | 회사 문서가 영어 외 언어는 성능이 눈에 띄게 낮다고 스스로 적음 (공식 문서) |
| 값이 유지되나 | 출시 가격은 약속이 아니다 | 회사가 「보조금이 아니라고 지금 증명할 수는 없다」고 발표문에 적음 |
네 줄을 모아 보면, 지금은 써 보고 싶은 사람이 작은 시험을 해 볼 단계이지, 팀의 반복 업무를 옮길 단계는 아닙니다. 모델이 나빠서가 아닙니다. 판단할 자료가 아직 쌓이는 중이기 때문입니다. 회사가 스스로 한계를 꽤 솔직하게 적어 둔 점은 오히려 믿을 만한 신호입니다.
어떤 AI가 제일 좋으냐는 질문에 답한 글에서는 「무엇을 쓰느냐」보다 「우리 일에 맞느냐」를 먼저 봐야 한다고 했습니다. 이번 질문은 그다음, 맞을 것 같은 새 모델이 나왔을 때 언제 옮기느냐의 문제입니다. 좋아 보이는 것과 지금 옮길 때인 것 사이에는 확인할 네 줄이 있습니다.
지금 해 둘 일은 「바꾸기」가 아니라 「시험 문제 만들기」입니다
바꾸지 않더라도 해 둘 일은 있습니다. 지금 AI로 하는 판정 업무에서, 정답을 아는 사례 20~30건을 모아 두십시오. 「이 문의는 환불이 맞다」처럼 사람이 이미 판정해 둔 것들입니다.
이 묶음이 있으면 새 모델이 나올 때마다 같은 문제로 비교할 수 있습니다. 회사 성능표 대신 우리 일에서의 성적을 보게 됩니다. 그리고 가입이 안정적으로 열려 있고, 우리말 성능이 확인되고, 가격이 몇 달 유지되면, 그때 이 묶음으로 한 번 돌려 보고 정하면 됩니다.
새 모델은 앞으로도 매달 나옵니다. 매번 「바꿀까」로 고민하는 대신, 한 번 만든 시험 문제로 매번 같은 방식으로 판단하는 편이 덜 흔들립니다.
무료 이북
도구는 갈아타는 것이고, 실력은 실려 가는 것입니다
데이터임팩트 박상훈
AI 글은 많이 읽었는데 여전히 뭘 어떤 순서로 해야 할지 모르겠다면. 10년, 130여 건의 기업 교육 현장에서 정리한 순서 한 장을 담았습니다. 지금 내가 어디에 있는지, 도구가 바뀌어도 안 바뀌는 것은 무엇인지, 그리고 오늘 붙일 한 줄까지.
노트북용 데스크톱판과 휴대폰에서 확대 없이 읽히는 모바일판을 함께 보내드립니다. 화면 열람용이라 인쇄는 제한되어 있습니다.