임정민 프로필 사진

임정민

Technical PM

무엇을 만들지 정하고, 그것이 실제로 만들어졌는지 확인합니다.

소개 영상04:16

지금까지 낸 결과

  • 7년

    Bixby PM

    2016.12 ~ 2023.07

  • 50개 이상

    3rd-party 캡슐

    Bixby 파트너 서비스

  • 40여 개

    한국 CP 캡슐 전담

    출시부터 개선, 출시 보류까지

  • 약 60% → 90% 이상

    한국 CP 발화 중 담당 캡슐 비중

    2019년 4월에서 2020년 하반기로, 날씨 제외

  • 5종

    맡은 기기

    Mobile, Watch, PC, Buds, Speaker

  • 4회

    최고 고과 EX

    그룹장 추천 특별 고과 S 1회

삼성전자2016.12 ~ 2023.07

Bixby

Bixby 1.0 출시 전에 합류해 7년 동안 파트너 서비스와 모든 기기의 경험을 맡았습니다.

  1. 파트너 캡슐3rd-party 캡슐 50개 이상, 한국 CP 캡슐 40여 개 전담
  2. 발화 비중한국 CP 발화 중 담당 캡슐 비중 약 60% → 90% 이상
  3. 모든 기기Mobile, Watch, PC, Buds, Speaker
Bixby 자세히 보기
Bixby 로고
멜론지니FLO벅스망고플레이트인터파크 항공인터파크 호텔스타벅스만개의 레시피KB부동산 Liiv ON연합뉴스MBC 뉴스SBS 뉴스SBS 라디오티팟원내비TmapU+모바일tv롯데시네마YouTubeGoogle MapsGmailAkinator시원스쿨

직접 기획하고 출시하거나 맡아 운영한 캡슐입니다. 출시부터 개선, 출시 보류까지 판단했습니다.

담당 캡슐이 차지한 한국 CP 발화 날씨 제외

담당 캡슐이 차지한 한국 CP 발화 비중이 2019년 4월 약 60%에서 2020년 하반기 90% 이상(날씨 제외)이 됐습니다. 사내 개발 CP 캡슐 40여 개를 넘겨받아 한국향 CP 캡슐 전체를 직접 맡았고, 음악 캡슐은 늘 최상위 사용량을 유지했습니다.

  • Watch보이스 시나리오, 넣을 캡슐, 호출 방식. 성능 개선과 신규 기능 상품화
  • Buds호출 뒤 알림음 없이 바로 말하기, 기기 사이 소리 자동 전환
  • Speaker파트너 캡슐 지원 확장, 미가입자 미리듣기
  • Mobile주머니 속과 화면을 볼 때의 응답 구분, 플래그십 소개 캡슐
  • PCTV 프로그램 안내와 방영 전 알림, 기기를 지정한 명령에 스마트 모니터 추가

여러 기기가 함께 있을 때는 Multi Device Wake-up(한 기기만 깨어나게)과 Device Dispatch(기기를 지정해 말하면 그 기기가 실행하게)를 요구사항으로 정했습니다.

회사를 나와 창업과 고객사 DX를 거치며 현장의 일을 가까이에서 봤습니다.

그 일을 시스템으로 옮겼습니다.

2026.07 ~

고객사 ㈜천지토건에서 2026.08.03부터 실제 업무에 사용

기업 운영 시스템

토목 건설 현장에 중장비와 기사를 보내는 고객사의 현장직과 사무직이 종이 달력과 카카오톡, 엑셀로 나눠 하던 일을 한 시스템으로 옮겼습니다.

  1. 배차종이 달력과 카카오톡 → 배차 캘린더
  2. 배차 한 건이 출발점매출, 정산, 재무, 세무가 여기서 계산됩니다
  3. 현장과 사무실현장에서 올린 기록이 그대로 사무실 기록이 됩니다
기업 운영 시스템 자세히 보기
기업 운영 시스템 배차 캘린더 화면
기업 운영 시스템 PC 대시보드 화면
기업 운영 시스템 모바일 화면

배차 캘린더. 종이 달력이 하던 일을 이 화면이 맡습니다.

오늘의 현황. 금액과 거래처는 가렸습니다. 배차 한 건을 매출, 매입, 재무, 세무의 공통 원천으로 두었습니다.

현장 직원이 불편했던 일(종이 달력, 카카오톡 배차)과, 사무직이 여러 구독형 앱을 오가며 하던 업무(계산서, 수금, 지급, 재무)를 한 시스템에 모아 모든 업무를 한곳에서 관리하게 했습니다.

AI를 쓸 곳과 쓰지 않을 곳을 직접 시험해 보고 정했습니다

현업 인터뷰와 요구사항 정리에서 시작해 업무 모델과 시스템 구조를 설계하고, AI 에이전트를 지휘해 구현한 뒤 배포와 운영까지 맡았습니다.

매입 세금계산서쓰지 않음정해진 형식을 규칙으로 읽는 편이 정확해 AI를 쓰지 않았다
영수증 입력초안만원본과 대조했다는 확인 뒤에만 등록
업무 조회질문 해석만답에 들어가는 숫자는 서버가 데이터베이스에서 만든다
등록 실행기존 경로 그대로AI도 화면이 쓰는 업무 함수와 권한 검사를 똑같이 거친다
금액 계산, 권한 판정쓰지 않음업무 규칙으로 처리
  • Python
  • FastAPI
  • SQLAlchemy
  • SQLite
  • React
  • TypeScript
  • Playwright
  • Claude API
  • Cloudflare Tunnel

AI와 여러 제품을 만들면서 "다 했습니다"라는 보고와 실제 결과가 다른 일을 자주 겪었습니다.

그 불편을 하나씩 모아 AI가 일하는 회사를 직접 만들었습니다.

2026.08 ~

집현

만들고 싶은 것을 한 문장으로 맡기면 AI 직원들이 회의부터 전달까지 진행하고, 그 결과를 AI의 보고가 아닌 검사 기록으로 판정하는 제품입니다.

  1. 방향 고르기AI가 만든 화면 시안 세 개 가운데 고르거나 섞습니다.
  2. 초안 확인만든 것과 검증한 것, 아직 검증하지 못한 것을 나눠 보여 줍니다.
  3. 완료 기준별 판정밖으로 나가는 일은 대표가 확인하기 전에는 시험하지 않습니다.
  4. 결과PC와 휴대폰에서 직접 확인합니다.
집현 자세히 보기
  1. 지시
  2. 회의
  3. 계획 확인
  4. 방향 고르기
  5. 만들기
  6. 초안 확인
  7. 재작업
  8. 제품화
  9. 이어서
집현 방향 고르기 화면
집현 초안 확인 화면
집현 완료 기준별 판정 화면
제품화한 휴가 관리 PC 화면
휴대폰에서 휴가 관리 화면을 확인하는 장면

사람이 결정하는 단계

왜 집현인가

학자들이 조사해 올리면 왕이 결정하던 집현전처럼, AI 직원들이 조사하고 만들고 서로 검증해 결과를 올리면 무엇을 받아들일지는 사람이 정합니다.

AI와 일하며 쌓인 불편에서 시작했습니다

  • 일이 끝나도 혼자 멈춰 있다
  • 다 했다는데 빠진 것이 많다
  • 같은 실수를 또 한다

이런 불편을 하나씩 해결할 장치를 모으다 보니 회사 모양이 됐습니다.

"다 했다"는 말 대신 근거로 판정합니다

  1. 후보
  2. 자동 검사
  3. 독립 검증
  4. 최종 지정

작업자에게는 결과를 확정할 권한이 없습니다. 검사가 실패하면 모델이 통과라고 해도 통과가 아니고, 아직 검증하지 못한 것은 따로 보여 줍니다.

그 밖의 프로젝트

AI 검색과 AI 판정자를 어디까지 믿을 수 있는지 공개 벤치마크로 직접 측정했고, 결과와 원자료를 모두 공개했습니다.

THEMIS2026.08

AI 판정자는 정답이 몇 번 보기에 있느냐에 따라 정확도가 크게 흔들렸습니다. 같은 문항에서 정답 위치만 바꿨는데 차이가 최대 약 62%p까지 났습니다.

판정 모델별로, 정답 위치(A~D)만 바꿨을 때 벌어진 정확도 차이

  • Skywork-Critic-Llama-3.1-8B62%p
  • Qwen2.5-7B-Instruct57%p
  • Con-J-Qwen2-7B27%p
  • Llama-3-OffsetBias-8B26%p
  • RISE-Judge-Qwen2.5-7B7%p

평가 도구 allenai/reward-bench에 이슈 4건과 PR 1건을 냈고, 그중 이슈 2건이 수정으로 이어졌습니다.

github.com/sixijsu77-hub/themis-judge-reliability

MIMIR2026.08

한국어 문서 검색에서 BM25, 임베딩, 둘을 섞은 하이브리드 가운데 무엇이 나은지 공개 벤치마크 3종으로 쟀습니다. 결과를 보기 전에 가설부터 등록했고, 공개 리더보드 수치 7개를 다시 재현해 5개는 소수 다섯째 자리까지 맞췄습니다.

하이브리드 가중치

00.51

미리 세운 예측 0.2~0.4 실제로 가장 좋았던 값 0.8~0.9

예측이 틀렸지만 결과는 그대로 공개했습니다.

github.com/sixijsu77-hub/mimir-korean-retrieval

NEIVY2025.10 ~ 2026.09

투자 이론을 배운 AI가 스스로 매매를 판단하게 만든 금융 도메인 실험입니다. 짧은 시험에서 좋아 보이던 결과가 긴 재검증에서 우연으로 드러난 뒤로는, 기능을 늘리기보다 검증 체계를 먼저 세웠습니다.

학습 한 세대에 걸리던 시간. 병목을 세 구간으로 나눠 재 보니 원인은 샘플링 I/O였습니다.

전약 50분
후약 6분

다음 제품

만들고 있습니다.

경력

Bizen2012.12 ~ 2013.05SKT 고객 DB와 서비스 플랫폼 운영
삼성전자2013.07 ~ 2014.12Tizen NX 카메라 UI 개발(C/C++)
군 복무2014.12 ~ 2016.09
삼성전자2016.09 ~ 2016.12DeX, Connect Auto 상품기획
삼성전자2016.12 ~ 2023.07Bixby PM. 최고 고과 EX 4회, 그룹장 추천과 인사팀장 결재를 거친 특별 고과 S 1회
아주대학교2018.03 ~ 2022.02글로벌경영학과 학사, 재직 중 야간
저스트랩스2023.12 ~ 2024.06창업, 대표. 단기 체류자 주거와 IoT 구독 서비스
㈜천지토건2024.07 ~ 2025.05DX팀 부장. 홈페이지, CRM, 업무 흐름 정비
프리랜서2025.10 ~ AI 제품 개발. 기업 운영 시스템, 집현

맡을 수 있는 일과 그 근거

Bixby기업 운영 시스템집현THEMISMIMIRNEIVY
제품 요구사항, 우선순위, 출시
파트너 서비스 연동과 여러 기기의 Voice UX
현업 업무 분석과 데이터 모델 설계
AI 적용 범위 판단과 모델 선택
AI 실행 구조, 권한, 검증 설계
AI 에이전트 개발 조직 운영
평가 설계와 외부 기준 검증
구축, 배포, 운영
임정민 프로필 사진

함께 만들 제품이 있다면