— Blog · 글

글을 쓰지 않는 AI, Jev

Jev picks one of your predefined answers and attaches a probability instead of writing text; a week of outside measurements shows where that is fast and cheap, and where it is not good enough.

TL;DR · English

TypeSafe AI released Jev in early access on 15 September 2026 with $40M in seed funding led by DCVC; it returns typed decisions with probabilities instead of text, at $0.042 per million input tokens with free output. Its "cannot hallucinate" claim only guarantees the answer's shape, and the game demos (Doom, Minecraft, a drone simulator, a flight search) all read game state written as text, with builder-reported numbers that nobody has reproduced. Independent tests found it level with small OpenAI models on short-text classification at a fraction of the cost, but weak on long documents, arithmetic and multi-step problems, and trustworthy mainly at its confident extremes. For a small game studio it looks like a fast gate inside a loop, not a replacement for rules or reasoning models, and TypeSafe itself says Korean is handled "not equally well".

2026년 9월 15일 공개된 Jev는 글을 한 줄도 쓰지 않는 AI 모델이다. 정해 둔 선택지 중 하나를 고르고 확률을 붙여 돌려줄 뿐이라 빠르고 싸다. 게임을 플레이하는 데모로 화제가 됐지만, 일주일 동안 쌓인 외부 측정을 보면 잘하는 일과 못하는 일이 분명하다.

우리는 게임을 만든다. 그래서 "AI가 둠(Doom)을 한다"는 영상이 돌 때 제일 먼저 궁금했던 건 이것이었다. 이게 게임 안에서 실제로 쓸 만한 속도와 값인가. 일주일치 자료를 모아 정리했다.

무엇이 나왔나what shipped

사실 샌프란시스코의 TypeSafe AI가 2026년 9월 15일 첫 모델 Jev를 얼리 액세스로 공개했다. 같은 날 DCVC가 이끈 4천만 달러 시드 투자와 함께 스텔스에서 나왔다(TypeSafe 공개 글, 2026년 9월 22일 조회). 대기 명단은 2026년 9월 20일(UTC) 공식 계정 공지로 없어졌다.

사실 회사는 창업자 디오고 알메이다(Diogo Almeida)를 "ChatGPT 공동 발명자"로 소개한다. 확인할 수 있는 근거는 OpenAI의 2022년 InstructGPT 논문에 20명 중 네 번째 저자로 올라 있다는 점이다(arXiv 2203.02155). 본인은 공개 글에서 지시를 따르는 방법을 "만드는 데 참여했다"고 좀 더 낮춰 썼다.

이름은 두 곳에서 왔다. 빠르고 직관적인 사고를 뜻하는 카너먼의 '시스템 1', 그리고 효율이 좋아질수록 소비가 늘어난다는 제번스의 역설이다. 회사는 Jev를 'System One 모델'이라는 새 부류라고 부른다.

작동 방식how it works

사실 요청에는 상황을 적은 텍스트나 JSON('state')과 미리 답의 형태를 정한 질문을 함께 보낸다. 질문은 선택지 고르기, 점수 매기기, 예/아니오 세 가지다. 돌아오는 것은 고른 답과 확률뿐이고 문장은 없다(TypeSafe 문서, 2026년 9월 22일 조회).

사실 값은 입력 100만 토큰당 0.042달러이고 출력은 무료다. 입력은 텍스트만 받고 이미지·음성·영상은 아직 안 된다. 한 요청에 6만 4천 토큰까지, 그중 상황과 가장 긴 질문을 합쳐 3만 2천 토큰까지다(모델 문서, 2026년 9월 22일 조회).

사실 속도 주장은 채널마다 다르다. 공개 글은 기존 모델보다 40~200배 빠르고 응답이 70~500ms라고 하고, 홈페이지는 193.6배 빠르고 444.6배 싸다고 하며, 보도자료는 최대 100배라고 한다. 회사 스스로 홈페이지 숫자는 자체 평가 기준이고 "실제 이득의 높은 쪽 끝"일 거라고 적었다(공개 글, 2026년 9월 22일 조회).

"환각이 없다"는 말은 무슨 뜻인가what "no hallucination" means

공개 당시 가장 큰 논쟁거리였다. 결론부터 말하면 답의 형태만 보장한다.

사실 회사의 자주 묻는 질문 페이지는 Jev가 "답의 모양은 보장하지만 모든 판단이 맞다고 보장하지는 않는다"고 적었다. 선택지 목록을 주면 목록 밖의 답을 지어낼 수는 없지만 틀린 답을 고를 수는 있다는 뜻이다(TypeSafe 홈페이지, 2026년 9월 22일 조회). 대표도 해커뉴스에서 "자신 있게 틀릴 수 있다"고 인정했다.

사실 개발자 아르민 로나허는 TechCrunch에 이 모델이 "환각 문제를 사용자에게 조금 떠넘긴다"고 말했다. 확률이 50%일 때와 95%일 때 어떻게 할지는 쓰는 쪽이 정해야 한다는 이야기다(TechCrunch, 2026년 9월 18일).

게임 데모가 보여 준 것what the game demos show

화제가 된 영상은 대부분 게임이었다. 공통점이 하나 있다. 모델은 화면을 보지 않았다. 게임 상태를 누군가 텍스트로 풀어서 넣어 줬다.

  • 사실 은 TypeSafe가 직접 만든 데모다. 게임 상태를 텍스트 데이터로 받아 초당 10번쯤 판단하고, 회사 계산으로 시간당 약 7달러가 든다. 회사 스스로 "AI가 아닌 스크립트 봇이 더 잘할 수 있다"고 적었다(공개 글).
  • 사실 마인크래프트는 외부 개발자가 만들었다. 338개 블록으로 캐나다 국기를 세우는 데 16분 31초 동안 2,266번 판단했고, 앞선 실행에서 잰 요청 왕복은 평균 128ms였다. 한 번의 성공이지 반복해도 된다는 증거는 아니라고 본인이 적었다(저장소, 2026년 9월 22일 조회).
  • 사실 드론 시뮬레이터는 카메라 영상을 일반 비전 코드가 JSON으로 바꾸고, 안전 반사는 코드가 초당 50번 따로 맡았다. Jev는 초당 2.5번쯤 방향만 골랐다. 65초 동안 80번 호출, 중앙값 0.11초였고 역시 한 번의 실행이다(저장소, 2026년 9월 22일 조회).
  • 사실 웹 에이전트 회사 Browser Use는 구글 항공권 검색을 7.1초에 0.0039달러로 끝냈다. 예약까지는 하지 않았고, 같은 작업을 세 번 반복한 결과라고 밝혔다(저장소, 2026년 9월 22일 조회).

사실 공개 후 나흘간의 트윗 1만 2,759개를 모은 분석에서, 사용자들이 직접 보고한 속도 향상의 중앙값은 7배였다. 홈페이지의 193.6배와는 거리가 있다(OpenChamber, 2026년 9월 22일 조회). 게임 데모 가운데 제삼자가 다시 재현해 결과를 낸 것은 아직 찾지 못했다.

밖에서 재 본 결과independent measurements

사실 개발자 아만 쿠마르가 약 1만 6천 번 호출해 본 결과가 가장 자세하다. 짧은 글 분류에서는 공개 데이터셋 네 개 중 세 개에서 OpenAI 소형 모델과 비슷하거나 앞섰고, 비용은 5~56배 쌌다. 77가지로 나누는 은행 문의 분류에서는 76.0%로 졌다. 문서 전체를 읽어야 하는 일에서는 지금 쓰는 작은 모델보다 못했고 프롬프트를 바꿔도 나아지지 않았다(측정 글, 2026년 9월 18일).

사실 그가 내린 사용법은 이렇다. 확률 0.9 이상인 답은 공개 데이터셋에서 약 96% 맞았고, 중간 구간은 동전 던지기에 가까웠다. 그래서 양 끝은 믿고 가운데는 문서를 제대로 읽는 모델에 넘기라고 했다. 동시에 100개를 보낼 때는 천 번에 몇 번꼴로 10~35초가 걸렸다(같은 글).

사실 회사 자체 평가에서도 Jev는 정확도 1등이 아니다. 네 가지 업무 흐름 평균 67.8%로, 가장 정확한 모델의 74.1%보다 낮다. 대신 한 건당 0.0004달러와 0.4초로, 그 모델의 0.0836달러와 23.3초보다 훨씬 싸고 빠르다(TypeSafe 평가 페이지, 2026년 9월 22일 조회). 회사 문서도 약점을 직접 적어 두었다. 계산과 개수 세기, 날짜 비교, 여러 단계를 건너야 하는 추론, 상관없는 내용이 많은 긴 입력, 입력에 끼어든 공격적인 문구다(약점 문서, 2026년 9월 17일 검토본).

사실 해커뉴스의 공개 글은 1,941점에 댓글 509개를 받았다(2026년 9월 21일 16:50 UTC, 해커뉴스). 구조를 공개하지 않은 것, 공개 벤치마크를 싣지 않은 것, 비슷한 모델을 오픈소스로 흉내 낸 후속작이 줄줄이 올라온 것까지 반응이 크게 갈렸다.

작은 게임 스튜디오가 보는 자리where it fits for a small studio

여기부터는 우리 생각이다. Jev는 게임을 대신 설계하는 도구가 아니다. 상황을 받아서 "지금 이 중에 뭘 할까"를 빨리 고르는 부품에 가깝다. 그렇게 보면 게임 쪽에서 떠오르는 자리가 몇 개 있다.

  • 게임 루프 안의 짧은 판단. NPC가 도망칠지 싸울지, 어느 아이템을 집을지처럼 선택지가 정해진 결정이다. 다만 둠 데모가 보여 주듯 게임 상태를 텍스트로 풀어 주는 일은 우리 몫이고, 스크립트가 더 잘하는 곳도 많다.
  • 자동 플레이 테스트. 버튼을 누르는 봇을 싸게 여러 판 돌리는 일이다. 사람처럼 잘 하지는 못해도, 막히는 구간을 찾는 데는 판 수가 중요하다.
  • 짧은 텍스트 판정. 랭킹 닉네임 필터 같은 예/아니오 문제다. 아만 쿠마르의 조언대로 확신이 높은 쪽만 자동으로 처리하고 나머지는 다른 방법에 넘기는 식이 맞아 보인다.

걸리는 것도 분명하다. 회사 문서는 한국어를 포함한 한중일 문자를 "처리하지만 똑같이 잘하지는 않는다"고 적었고, 한국어로 잰 결과는 아직 찾지 못했다. 서버가 미국 서부에 있어서 한국에서 부르면 발표된 지연보다 느릴 것이다. 가중치는 공개되지 않았고 기본 버전 이름은 새 모델이 나오면 조용히 바뀐다. 무료 출력 가격이 오래갈지는 회사도 "장기적으로 증명해야 한다"고 적었다.

그래서 우리 결론은 이렇다. 빠른 직감으로는 쓸 만하고, 판단 전체를 맡기기에는 아직 이르다. 규칙으로 되는 일은 규칙으로 하고, 오래 생각해야 하는 일은 생각하는 모델에 맡긴다. 그 사이의 짧고 잦은 선택이 Jev의 자리다.