사내 AI 성숙도 진단 체크리스트: 40문항으로 확인하는 우리 회사 5단계 레벨

회의실에 침묵이 흘렀다.
“우리 회사 AI 도입 수준이 어느 정도인가요?” 임원의 질문에 아무도 답하지 못했습니다. 챗GPT를 쓰는 직원은 많다고 들었지만, 몇 명인지 어떤 업무에 쓰는지 아는 사람이 없었죠. 그다음 주 교육 예산 품의를 올려야 하는데, 현황란에 적을 숫자가 하나도 없습니다. 이럴 때 필요한 것이 감이 아니라 기준으로 움직이는 사내 AI 성숙도 진단입니다.
이 글을 처음부터 끝까지 읽을 필요는 없습니다. 지금 당장 우리 조직의 점수부터 알고 싶다면 3분 무료 AI 성숙도 진단으로 먼저 레벨과 병목을 확인한 뒤, 해당 레벨 섹션만 골라 읽어도 충분합니다.
핵심 요약
- 사내 AI 성숙도 진단의 기준은 ‘누가 챗GPT를 쓰는가’가 아니라 데이터·기술·인력문화·거버넌스·성과측정 5개 축
- Databricks·커니·Microsoft Learn 프레임워크 모두 명칭만 다른 5단계 구조, 국내 기업 다수는 레벨 1~2 구간
- 본문 40문항 스코어카드(100점 만점)로 레벨 산출 + HR·영업·IT·생산 부서별 편차 확인
- 레벨별 다음 30일 과제의 차이, 레벨 1 조직에 레벨 3용 교육을 넣었을 때의 예산 소모와 이탈률 급등
담당자가 막히는 지점은 대개 같습니다. AI 교육이 필요하다는 건 알겠는데, 지금 우리가 어디쯤인지 말할 언어가 없다는 것. 그래서 사내 AI 성숙도 진단 없이 곧장 “전 직원 프롬프트 교육 4시간”으로 넘어가고, 반년 뒤 아무것도 바뀌지 않았다는 결론에 도달합니다.
이 글은 그 앞단을 채웁니다. 40문항 스코어카드로 조직의 레벨을 숫자로 산출하고, 부서별 편차를 확인한 뒤, 레벨에 맞는 30일·90일 실행 계획을 직접 작성하는 순서입니다.
근거는 세 갈래입니다. Databricks의 AI 거버넌스 성숙도 모델, 커니의 글로벌 AI 진단(AIA), Microsoft Learn의 에이전틱 AI 성숙도 모델 등 5개 프레임워크를 단계 명칭 단위로 비교했고, 여기에 40곳 이상 기업·기관에서 교육을 진행하며 반복해서 본 장면을 얹었습니다.
교육 설계 전체 흐름이 궁금하다면 사내 AI 교육 완전 가이드: 진단부터 성과 측정까지 8단계 실행법을 먼저 보는 편이 낫습니다. 이 글은 그 8단계 중 첫 단계인 ‘진단’만 깊게 파고듭니다.
교육 기획서를 쓰기 전에 왜 성숙도부터 진단해야 할까요?
“전 직원 프롬프트 교육 4시간.” 이 한 줄로 품의서를 올려본 적이 있다면, 그 뒤에 무슨 일이 벌어졌는지도 아실 겁니다.
절반은 이미 아는 내용이라 지루해하고, 절반은 못 따라옵니다. 그리고 3주 뒤면 아무도 쓰지 않습니다.
일괄 커리큘럼이 무너지는 지점은 대체로 셋입니다. 수준 편차, 업무와의 연결 부재, 교육 후 관리 공백.
수준 편차는 강의장에서 바로 드러납니다. 챗GPT를 매일 쓰는 사람과 계정조차 없는 사람이 같은 자리에 앉아 있으니까요.
업무 연결 부재는 조금 늦게 드러납니다. 실습은 다 했는데 내 업무 파일을 열면 무엇부터 해야 할지 모르는 상태 말입니다.
사후 관리 공백은 가장 조용히 옵니다. 아무도 실패했다고 말하지 않지만, 다음 분기 품의는 통과되지 않습니다.
그래서 사내 AI 성숙도 진단이 교육 설계보다 앞에 옵니다. 순서를 바꾸면 예산이 아니라 신뢰를 잃습니다.
여기서 한 가지를 구분해야 합니다. AI 교육 니즈 조사와 성숙도 진단은 다른 질문을 던집니다.
니즈 조사는 “무엇을 배우고 싶은가”를 묻습니다. 답은 대체로 “실무에 바로 쓰는 것”으로 수렴하고, 그 문장으로는 커리큘럼을 짤 수 없습니다.
성숙도 진단은 “조직이 지금 무엇을 받아들일 수 있는가”를 묻습니다. 데이터가 없는데 데이터 분석 교육을 넣는 실수는 이 질문으로 걸러집니다.
두 조사는 배타적이지 않습니다. 순서가 있을 뿐입니다. 진단으로 받아들일 수 있는 범위를 정하고, 니즈 조사로 그 안에서 우선순위를 정합니다.
진단 결과는 교육 목표에서 멈추지 않습니다. 예산 규모, 업체 선정 기준, 성과 지표까지 연쇄적으로 결정됩니다.
레벨 1 조직이라면 목표는 ‘전사 확산’이 아니라 ‘한 팀의 성공 사례 1건’입니다. 예산은 작아지고, 업체는 강의력보다 산출물 설계 능력으로 고릅니다.
레벨 3 조직은 반대입니다. 강의가 아니라 표준과 AI 도입 컴플라이언스 검토 프로세스가 병목이라, 교육 예산의 일부를 가이드라인 수립에 써야 합니다.
이 글이 다루는 범위를 먼저 말해두겠습니다. 진단 도구, 5단계 판별 기준, 부서별 진단 매트릭스, 그리고 결과에 따른 로드맵 분기까지입니다.
커리큘럼 설계와 성과 측정은 다루지 않습니다. 그 두 가지는 사내 AI 교육 완전 가이드의 4단계·8단계에서 이미 다뤘습니다.
이 글은 그 가이드의 1단계, AI 도입 준비도 평가를 파고드는 자리입니다. AI 전략 수립의 첫 문장을 어디서 시작할지 정하는 셈이죠.
AI 성숙도 5단계, 우리 회사는 어디에 해당하나요?
“우리는 아마 2단계쯤 되겠죠?” 진단 워크숍에서 가장 먼저 나오는 말입니다. 대부분 실제보다 한 단계 높게 잡습니다.
단계는 도입한 도구 수로 정해지지 않습니다. 조직 안에서 오가는 대화의 종류로 정해집니다.
레벨 1~2: 개인이 몰래 쓰는 단계에서 부서 파일럿까지
레벨 1(임시·탐색)은 “그거 회사 계정으로 써도 되나요?”라는 질문이 답을 못 받는 단계입니다.
- 개인 계정으로 각자 쓰고, 회사는 그 사실을 공식적으로 모릅니다
- AI 사용 가이드라인 문서가 없거나, 있어도 “주의해서 쓰세요” 한 줄입니다
- 어느 부서가 무엇에 쓰는지 집계할 방법이 없습니다
레벨 2(도입·파일럿)는 “그 팀은 그걸로 보고서 쓴다던데”가 복도에서 도는 단계입니다.
- 한두 부서가 유료 계정을 받아 파일럿을 돌립니다
- 성과는 개인 역량에 붙어 있어, 담당자가 옮기면 사라집니다
- 파일럿 결과를 다른 부서로 옮길 표준 문서가 없습니다
레벨 2에 정체된 조직은 대개 도구가 부족한 게 아닙니다. 잘 쓰는 사람의 방식을 문서로 꺼내지 못한 상태입니다.
레벨 3~5: 표준화·거버넌스 단계에서 AI 내재화까지
레벨 3(정의·확산)은 “그건 사내 가이드 3조에 어긋납니다”라는 말이 회의에서 나오는 단계입니다.
- 승인된 도구 목록과 데이터 입력 금지 항목이 문서로 존재합니다
- 부서별 담당자가 지정되고 RACI 매트릭스로 책임이 나뉩니다
- 생성형 AI(GenAI) 활용 사례가 부서 경계를 넘어 이전됩니다
레벨 4(관리·최적화)는 “이번 분기 AI 도입 ROI가 얼마죠?”를 CFO가 묻는 단계입니다.
- 모델 레지스트리와 데이터 리니지가 운영되어 무엇이 어디서 왔는지 추적됩니다
- KPI에 AI 활용 지표가 들어가 있고, 기준선 대비로 측정됩니다
- NIST AI RMF나 ISO 42001 같은 외부 기준에 맞춰 내부 통제를 점검합니다
레벨 5(혁신·내재화)는 AI를 뺀 업무 프로세스를 상상하기 어려운 상태입니다. Advanced Analytics와 멀티 에이전트 시스템이 사람의 판단 사이사이에 들어가 있죠.
국내에서 레벨 5를 자신 있게 말할 수 있는 기업은 많지 않습니다. 그리고 그게 문제도 아닙니다.
Databricks·커니·MS Learn·CMU 프레임워크 명칭 비교표
프레임워크마다 이름이 달라서 회의가 산으로 갑니다. 같은 단계를 다르게 부르는 것뿐입니다.
| 레벨 | 본 글 | Databricks | Kearney(커니) | Microsoft Learn | CMU 계열 |
|---|---|---|---|---|---|
| 1 | 임시·탐색 | Ad hoc(임시) | AI 미착수 | 100 단계 | Initial |
| 2 | 도입·파일럿 | Reactive(대응) | AI 실험 단계 | 200 단계 | Managed |
| 3 | 정의·확산 | Defined(정의) | AI 확산 단계 | 300 단계 | Defined |
| 4 | 관리·최적화 | Managed(관리) | AI 선도 기업 | 400 단계 | Quantitatively Managed |
| 5 | 혁신·내재화 | Optimized(최적화) | AI 네이티브 | 500 단계 | Optimizing |
Databricks는 거버넌스 관점에서 단계를 나눕니다(AI 거버넌스 성숙도 모델). 커니는 성과와 확장성 축을 함께 봅니다.
Microsoft Learn의 에이전트 도입 성숙도 모델은 100~500 숫자 체계라 부서 간 비교에 쓰기 편합니다. 카네기멜런대학교(CMU)의 CMMI 계열 용어는 IT 부서가 익숙해합니다.
어느 이름을 쓰든 상관없습니다. 사내에서 하나만 골라 끝까지 쓰는 게 중요합니다.
단계를 건너뛸 수 없는 이유는 단순합니다. 레벨 3의 표준은 레벨 2에서 나온 실패 사례를 재료로 만들어지기 때문입니다.
가장 많이 좌초하는 구간은 2에서 3입니다. 파일럿은 성공했는데 확산 승인이 나지 않는 상태, 대부분 거버넌스 공백 때문입니다.
“이 데이터를 넣어도 되나”에 답할 사람이 없으면 확산은 멈춥니다. 더 자세한 단계별 진행은 AI 활용 성숙도 가이드에서 분기별로 정리해뒀습니다.
국내 기업 다수가 레벨 1~2에 머무는 이유도 여기에 있습니다. 도구 도입은 구매 결정이지만 레벨 3은 조직 결정이고, 조직 결정에는 책임자가 필요합니다.
무엇을 측정해야 하나요? 성숙도를 가르는 5개 진단 축
“우리 3단계 같은데요.” 이 말은 대부분 반만 맞습니다. 기술은 3단계인데 문화는 1단계인 조직이 흔하거든요.
그래서 단일 점수 하나로 레벨을 정하면 위험합니다. 최소 다섯 개 축으로 나눠 봐야 합니다.
축은 이렇게 나눕니다. 전략·리더십, 데이터·기술 인프라, 인력·역량·문화, 거버넌스·리스크, 성과 측정 체계.
데이터·기술 인프라 축: 데이터 리니지와 모델 레지스트리가 있습니까
이 축에서 레벨을 가르는 질문은 하나입니다. “이 숫자가 어디서 왔는지 30분 안에 추적할 수 있습니까.”
데이터 리니지가 없으면 AI 산출물을 감사에 제출할 수 없습니다. 모델 레지스트리가 없으면 어떤 버전이 어떤 보고서를 만들었는지 모릅니다.
레벨 1~2에서는 이 두 가지가 없어도 굴러갑니다. 레벨 3부터는 없으면 멈춥니다.
인력·문화 축: 데이터 리터러시와 실험 허용도
이 축은 두 가지를 봅니다. 데이터 리터러시 수준, 그리고 실패해도 되는 정도.
실험 허용도가 낮은 조직에서는 아무도 새 도구를 먼저 써보지 않습니다. 잘못되면 혼자 책임지는 구조니까요.
한 IT 기업 마케팅팀에서 받은 요청이 이 축을 정확히 보여줍니다. 잘 쓰는 직원과 못 쓰는 직원의 간극이 벌어지자, 그건 생산성 문제가 아니라 위화감이라는 조직 문제가 됐다고 했습니다.
격차 해소를 교육 주제로 요청받은 적이 있습니다. 개인기가 아니라 팀의 표준을 만들어달라는 뜻이었습니다.
| 축 | 레벨 1 | 레벨 2 | 레벨 3 | 레벨 4 | 레벨 5 |
|---|---|---|---|---|---|
| 전략·리더십 | 경영진 언급 없음 | 관심 표명, 예산 없음 | 연간 계획에 항목 존재 | 사업 목표와 연동 | AI가 전략 전제 |
| 데이터·기술 인프라 | 데이터 산재 | 부서별 도구 도입 | 공용 플랫폼·접근 권한 정의 | 데이터 리니지·모델 레지스트리 운영 | 실시간 파이프라인 자동화 |
| 인력·역량·문화 | 개인 관심자만 사용 | 일부 부서 학습 모임 | 직무별 교육 체계 존재 | 역량 평가·인증 연동 | 전사 공통 언어로 정착 |
| 거버넌스·리스크 | 규정 없음 | 구두 주의 수준 | 사용 가이드·RACI 매트릭스 문서화 | NIST AI RMF·ISO 42001 대응 | 사전 리스크 시뮬레이션 상시 |
| 성과 측정 체계 | 측정 안 함 | 체감 만족도만 | 시간 절감 등 단일 지표 | KPI 연동·기준선 비교 | 사업 손익에 직접 반영 |
이 성숙도 매트릭스에서 축별 점수를 매겨보면 대개 그림이 삐뚤어집니다. 기술 축만 앞서고 문화 축이 뒤처지는 형태가 가장 흔합니다.
도구는 구매하면 다음 달에 도착하지만, 문화는 구매할 수 없기 때문입니다. 기울어진 성숙도는 그래서 실패라기보다 시차입니다.
문제는 이 시차를 방치할 때입니다. 라이선스는 500개인데 실사용자가 40명인 상황이 여기서 나옵니다.
AI 역량 진단 설문으로 옮길 때는 각 축을 4~6문항으로 쪼갭니다. “우리 회사는 AI 전략이 있다” 같은 추상 문항은 빼는 편이 낫습니다.
대신 사실을 묻습니다. “AI 사용 가이드라인 문서를 열어본 적이 있다”, “지난달 업무에 AI를 쓴 횟수는 몇 회인가” 같은 식으로요.
조직 역량 진단에서 가장 값진 데이터는 갭입니다. 경영진과 실무자에게 같은 문항을 던지고 점수 차를 보는 대조 설계 말입니다.
예를 들어 “AI 활용에 필요한 데이터에 접근할 수 있다”를 양쪽에 물으면, 경영진 4.2점 실무자 2.1점 같은 결과가 나옵니다. 이 2.1의 차이가 다음 분기 과제입니다.
저는 40곳 넘는 기업과 기관에서 교육을 진행하면서 이 갭을 반복해 봤습니다. 위에서는 이미 깔아줬다고 믿고, 아래에서는 권한이 없다고 말하는 장면입니다.
설문을 돌릴 시간이 없다면 AI 성숙도 자가진단 30문항으로 축별 점수를 먼저 잡아도 됩니다. 여기서 나온 병목이 뒤에 나올 부서별 진단의 출발점이 됩니다.
40문항 자가진단 스코어카드: 지금 바로 점수를 매겨보세요
진단을 하라는 말은 많은데, 정작 무엇을 물어야 하는지 알려주는 자료는 드뭅니다. 그래서 대부분 “우리는 중간쯤”이라는 감으로 넘어갑니다.
감은 품의서에 쓸 수 없습니다. 숫자가 있어야 예산도, 교육 대상도 정해집니다.
아래는 앞에서 정의한 5개 축을 각 8문항으로 풀어낸 자가진단 체크리스트입니다. 문항마다 전혀 아니다 0점 / 일부 그렇다 1점 / 대체로 그렇다 2점 / 완전히 그렇다 2.5점을 매기면 축당 20점, 총 100점이 나옵니다.
5개 축 × 8문항 진단 체크리스트
전략·리더십 축입니다. 이 축이 낮으면 나머지 점수가 높아도 확산이 멈춥니다.
- 경영진이 AI 활용에 관한 공식 메시지를 최근 6개월 안에 사내에 전달했다
- AI 도입 목표가 매출·비용·시간 중 하나의 숫자로 문서화돼 있다
- AI 관련 예산이 IT 예산과 분리된 별도 항목으로 편성돼 있다
- 과제 우선순위를 정하는 기준(임팩트·난이도)이 합의돼 있다
- AI를 담당하는 조직 또는 겸직 책임자가 이름으로 지정돼 있다
- 부서장급이 자기 부서의 AI 과제를 자기 말로 설명할 수 있다
- AI 도입 항목이 중기 사업계획 문서 안에 들어가 있다
- 성과가 없는 파일럿을 종료하거나 전환한 의사결정 기록이 있다
데이터·기술 인프라 축입니다. 도구 계정 수가 아니라 데이터가 놓인 상태를 묻습니다.
- 핵심 업무 데이터가 개인 PC가 아니라 공용 저장소에 있다
- 주요 데이터의 출처와 흐름을 데이터 리니지 문서로 확인할 수 있다
- 계약서·보고서·상담 로그 같은 비정형 문서가 검색 가능한 형태로 쌓인다
- 전사 승인된 AI 도구 목록이 있고 정식 계정이 발급된다
- 사내 시스템과 AI 도구를 연결해 실제로 쓰는 사례가 하나 이상 있다
- 프롬프트·모델 자산을 등록하고 버전을 관리하는 모델 레지스트리가 있다
- 개인정보·기밀 등급이 데이터 자체에 표시돼 있다
- AI 도구 사용 로그를 IT가 확인할 수 있다
인력·역량·문화 축입니다. 직원 AI 활용 실태 조사와 겹치는 부분이라, 이 8문항만 따로 떼어 돌려도 쓸모가 있습니다.
- 직원 절반 이상이 주 1회 이상 업무에 AI를 쓴다
- 잘 쓰는 직원의 프롬프트가 팀 안에서 공유된다
- AI 활용이 평가·승진 대화에서 실제로 언급된다
- 부서마다 활용을 이끄는 담당자가 있다
- 일자리 불안을 공개적으로 꺼낼 수 있는 분위기다
- 신규 입사자 온보딩에 AI 도구 안내가 포함돼 있다
- 실패 사례를 공유해도 불이익이 없다
- 직무별 활용 격차를 조직이 수치로 파악하고 있다
거버넌스·리스크 축입니다. 대개 여기서 점수가 무너집니다.
- AI 사용 가이드라인이 문서로 있고 최신 버전이 공지돼 있다
- 입력하면 안 되는 데이터가 예시 수준까지 명시돼 있다
- 산출물 검토·승인 책임자가 문서에 지정돼 있다
- AI 관련 사고 발생 시 신고·대응 절차가 있다
- 채용·평가·의료·신용 같은 고위험 용도를 따로 구분해 관리한다
- 외부 AI 벤더의 데이터 처리 조건을 법무가 검토한다
- NIST AI RMF나 ISO 42001 같은 외부 기준을 한 번이라도 참조했다
- 생성형 AI 산출물의 출처 표기·저작권 규칙이 있다
성과 측정 축입니다. 마지막 축이 비어 있으면 다음 해 예산이 줄어듭니다.
- 도입 전 기준선(작업 시간·건수·오류율)을 측정해 뒀다
- 과제별 KPI가 착수 시점에 정의된다
- 절감 시간을 금액으로 환산하는 공식이 합의돼 있다
- 분기마다 AI 성과를 경영진에 보고한다
- 교육 후 행동 변화를 추적하는 지표가 있다
- 도구별 활성 사용자 비율을 확인한다
- 성과가 낮은 과제를 중단한 기록이 있다
- 성과 데이터가 다음 분기 과제 선정에 반영된다
점수 환산표와 레벨 판정 기준
합산 점수를 그대로 구간에 대입하면 레벨이 나옵니다. 0~20점은 레벨 1, 21~40점은 레벨 2, 41~60점은 레벨 3, 61~80점은 레벨 4, 81~100점은 레벨 5입니다.
여기서 한 번 더 봐야 할 게 축별 점수입니다. 축당 만점은 20점이고, 최저 축이 평균보다 5점 이상 낮으면 조직의 실제 레벨은 그 최저 축을 따라갑니다.
총점 62점이어도 거버넌스가 6점이면 레벨 4가 아니라 레벨 2~3으로 읽는 편이 안전합니다. 확산 속도는 가장 약한 축이 결정하기 때문입니다. 문항별 배점과 영역 해석을 더 촘촘히 보고 싶다면 AI 성숙도 자가진단 30문항 버전과 교차로 확인하는 방법도 있습니다.
진단을 돌릴 때의 실무 규칙: 대상자·응답 방식·소요 시간
같은 문항을 세 집단에 돌리는 게 핵심입니다. 경영진 3~5명, 부서장 전원, 실무자 표본 30명 이상. 이 3중 응답이 있어야 인식 갭이 보입니다.
응답 시간은 12~15분을 넘기지 않게 설계합니다. 익명 응답을 원칙으로 하되 부서와 직급 구간만 받으면 부서별 비교가 가능해집니다.
거버넌스 문항을 맨 앞에 두면 방어적인 답이 몰립니다. 전략 → 인력·문화 → 데이터 → 성과 → 거버넌스 순으로 배치하면 왜곡이 줄어듭니다.
이 AI 역량 진단 설문을 교육 전 사전 진단 문항으로 재활용할 때는 개인 항목 5개를 뒤에 붙입니다. 주당 사용 빈도, 주로 쓰는 도구, AI로 처리 중인 업무 1건, 가장 자주 막히는 지점, 이번 교육에서 해결하고 싶은 문제입니다.
설문을 돌릴 여유가 없는 시점도 있습니다. 그럴 때는 3분 진단으로 조직 점수와 병목 축을 먼저 뽑아 기획서 배경란에 붙이고, 정식 스코어카드는 착수 후에 돌리는 순서도 가능합니다.
전사 평균은 함정입니다: HR·영업·IT·생산 부서별 진단 기준
총점 55점이 나오면 안심하게 됩니다. 그런데 그 55점이 IT 80점과 생산 25점의 평균이라면 이야기가 완전히 달라집니다.
이 조직에 전사 공통 교육을 돌리면 IT는 지루해서 이탈하고 생산은 따라오지 못해 이탈합니다. 평균값에 맞춘 커리큘럼이 실패하는 이유입니다.
커니(Kearney)의 글로벌 AI 진단 조사도 성숙도를 단일 점수가 아니라 확장성과 성과로 나눠 봅니다. 조직 안에서도 같은 분해가 필요합니다.
부서별 성숙도 판별 신호 매트릭스
기능별로 물어야 할 것이 다릅니다. 각 부서 4문항씩만 추가하면 부서별 AI 성숙도가 드러납니다.
- HR — 채용 공고·직무기술서가 표준 양식으로 축적되는가 / 평가 코멘트가 텍스트 데이터로 남는가 / 채용 스크리닝에 AI를 쓸 때 검토 책임자가 지정돼 있는가 / 교육 이력이 개인 단위로 조회되는가
- 영업 — 제안서 과거 버전이 검색 가능한가 / CRM 입력 규칙이 지켜져 데이터가 비어 있지 않은가 / 고객 미팅 노트가 구조화된 형태로 남는가 / 고객사 정보를 외부 AI에 입력하지 않는 기준이 공유돼 있는가
- IT·개발 — 코드 어시스턴트 사용 정책이 문서로 있는가 / 모델·프롬프트 자산의 버전이 관리되는가 / 운영 중인 모델의 성능 저하를 감지하는 장치가 있는가 / 데이터 리니지를 추적할 수 있는가
- 생산·품질 — 공정 데이터가 실시간으로 수집·저장되는가 / 설비 로그와 불량 이력이 연결되는가 / 작업일지·점검표 같은 비정형 기록이 디지털화돼 있는가 / 현장 인력이 접근 가능한 AI 도구가 있는가
- 재무·법무 — 규제 문서 검토에 AI 사용이 허용돼 있는가 / 산출물의 근거 확인 절차가 있는가 / 외부 공개 문서에 대한 검수 단계가 있는가 / 계약서 데이터의 보안 등급이 분류돼 있는가
| 부서 | 레벨 1~2 | 레벨 3 | 레벨 4~5 |
|---|---|---|---|
| HR | 공고·메일 초안 작성 | 직무기술서 표준화, 면접 질문 생성 | 역량 데이터 기반 배치 추천, 검토자 지정 운영 |
| 영업 | 제안서 문구 다듬기 | 과거 제안서 검색 기반 초안 생성 | CRM 연동 리드 스코어링, 고객별 제안 자동화 |
| IT·개발 | 개인 단위 코드 어시스턴트 | 사내 문서 기반 검색 시스템 운영 | 모델 레지스트리 운영, 멀티 에이전트 시스템 시범 |
| 생산·품질 | 보고서 요약 정도 | 공정 로그 이상 탐지 파일럿 | Advanced Analytics 기반 예지보전·수율 예측 |
| 재무·법무 | 사용 금지 또는 개인 실험 | 규정 검토 보조, 근거 확인 절차 병행 | 계약 리스크 자동 플래깅, 감사 추적 체계 |
부서 편차가 클 때 교육 설계를 어떻게 바꿔야 하나요
편차가 2레벨 이상 벌어졌다면 같은 교육에 넣지 않는 것이 원칙입니다. 상위 부서는 사례 제공자로, 하위 부서는 기초 리터러시 트랙으로 분리합니다.
선도 부서를 앵커로 세우는 방식이 잘 먹힙니다. 외부 강사의 사례보다 옆 부서 사례가 저항을 줄이기 때문입니다.
한 IT 기업 마케팅 조직에서 받은 요청이 이 지점을 정확히 짚었습니다. 잘 쓰는 직원과 못 쓰는 직원의 간극이 벌어지자, 그건 생산성 문제가 아니라 위화감이라는 조직 문제가 됐다는 것이었습니다. 격차 해소를 교육 주제로 요청받는다는 건 개인기가 아니라 팀의 표준을 만들어달라는 뜻입니다.
부서 진단 결과는 커리큘럼 분기의 입력값이 됩니다. 부서명, 평균 점수, 최저 축, 대표 업무 1건. 이 네 가지를 표로 정리해 넘기면 AI 업무 활용 단계에서 직무별 과제를 그대로 이어붙일 수 있습니다.
거버넌스 점수는 왜 항상 가장 낮게 나올까요?
진단을 돌려보면 거의 예외 없이 거버넌스 축이 꼴찌입니다. 담당자가 게을러서가 아닙니다.
도구는 개인이 먼저 쓰기 시작하고, 규칙은 사고가 나야 만들어집니다. 그래서 활용 성숙도와 AI 거버넌스 성숙도는 따로 움직입니다.
거버넌스만 낮은 조직이 가장 위험합니다. 쓰는 사람은 많은데 책임자가 없는 상태이기 때문입니다.
NIST AI RMF·ISO 42001·EU AI Act로 보는 거버넌스 진단 기준
외부 기준을 통째로 도입할 필요는 없습니다. 각 기준의 핵심 질문만 사내 문항으로 축약하면 진단에는 충분합니다.
| 기준 | 핵심 요구 | 사내 진단 문항으로 축약 |
|---|---|---|
| NIST AI RMF (Govern) | 역할·정책·책임 정의 | AI 사용 승인 권한자가 문서에 지정돼 있는가 |
| NIST AI RMF (Map·Measure) | 용도별 맥락·위험 식별과 측정 | 어떤 업무에 어떤 AI를 쓰는지 목록이 있고 오류율을 재는가 |
| NIST AI RMF (Manage) | 위험 대응·사고 처리 | 잘못된 산출물이 외부로 나갔을 때의 절차가 있는가 |
| ISO 42001 | AI 경영시스템의 문서화·개선 주기 | 가이드라인의 개정 이력과 담당 부서가 있는가 |
| EU AI Act | 위험등급 분류와 고위험 용도 통제 | 채용·평가·신용 용도를 별도 등급으로 관리하는가 |
| 국내 AI 기본법·개인정보보호법(확인 필요) | 고영향 AI 고지·자동화 결정 대응 | AI가 개입한 결정을 당사자에게 알리고 이의를 받을 창구가 있는가 |
국내 규제는 시행령·고시 단계에서 세부 기준이 계속 정리되고 있어, 위 항목은 진단 시점에 최신 조문을 다시 확인하는 편이 안전합니다. 단계별 통제 설계는 데이터브릭스의 AI 거버넌스 성숙도 모델이 참고할 만한 골격을 제공합니다.
국내 AI 기본법 시행 흐름과 준비도 점검 항목
규제 산업일수록 요청이 구체적입니다. 한 제약사 사업부 강의에서는 시작 전에 이런 주문을 받았습니다. 민감정보를 입력하지 말라는 당부로 문을 열어달라, 할루시네이션 방지와 출처 제시를 깊게 다뤄달라. 이미 부서용 앱까지 만들어 쓰는 팀이었는데도, 다음 고민은 도구가 아니라 ‘출처를 어떻게 믿게 만들 것인가’였습니다.
역할이 비어 있으면 규칙도 작동하지 않습니다. RACI 매트릭스로 최소 세 가지 상황의 책임을 배정해두면 진단 점수가 실제로 올라갑니다.
- AI 도구 사용 승인 — 실행 IT, 최종 책임 정보보호책임자, 협의 법무, 통보 현업 부서장
- 산출물 검증·모델 검토 — 실행 현업 담당자, 최종 책임 부서장, 협의 품질·의학부, 통보 감사
- 사고 대응 — 실행 보안팀, 최종 책임 CISO, 협의 홍보·법무, 통보 경영진
거버넌스 점수가 낮은 조직이 교육에서 빼면 안 되는 모듈은 둘입니다. 입력 금지 데이터 실습, 그리고 산출물 근거 확인 절차입니다. 고위험 업무를 다루는 부서라면 위험등급 판별 실습을 하나 더 얹습니다.
업종별 통제 수준을 더 보려면 규제산업 AI 도입 로드맵이, 내부 승인 절차를 설계하는 단계라면 AI 도입 컴플라이언스 검토 7단계가 다음 참고점이 됩니다.
국내 기업 3곳은 진단 후 무엇이 달라졌나요? (성공·실패 사례)
점수는 나왔습니다. 그런데 “그래서 뭐가 달라지냐”는 질문이 회의실에 남습니다.
아래 세 곳은 업종과 규모만 남기고 지웠습니다. 숫자는 앞 섹션의 100점 스코어카드 기준입니다.
사례 A는 제조 중견기업이었습니다. 전사 평균 24점, 레벨 1. 전 직원 공통 교육 4시간이 이미 품의에 올라가 있었습니다.
부서별로 쪼개니 IT 58점, 생산 19점이 나왔습니다. 같은 날 같은 강의실에 앉히는 설계가 그 자리에서 무너졌습니다.
결정은 축소가 아니라 초점 이동이었습니다. 예산은 유지하고 대상만 생산·품질 2개 팀으로 줄여 12주 AI 파일럿을 돌렸습니다.
대상을 줄이는 결정은 후퇴처럼 읽힙니다. 진단표가 있으면 그게 설명 가능한 선택이 됩니다.
사례 B는 금융·서비스 기업이고, 두 해 연속 레벨 2에 머물렀습니다. 도구도 있고 쓰는 사람도 있는데 점수가 오르지 않았습니다.
축별로 보니 거버넌스가 20점 만점에 6점이었습니다. 사용 승인 절차와 사고 대응 담당자가 비어 있었던 겁니다.
이 회사는 교육 일정을 한 분기 미뤘습니다. 대신 허용 도구·금지 데이터·검토 라인만 담은 세 장짜리 가이드라인을 먼저 냈습니다.
규제 산업일수록 요청이 구체적입니다. 한 제약사 사업부는 강의 전에 “민감정보를 AI에 넣지 말라는 당부로 시작해달라”는 요청부터 보내왔습니다.
이미 부서용 앱까지 만들어 쓰는 팀이었는데도 그랬습니다. 다음 고민은 도구가 아니라 출처를 어떻게 믿게 만드느냐였고, 이런 조직의 규제산업 AI 도입 순서는 늘 가이드라인이 먼저였습니다.
사례 C는 IT·플랫폼 기업으로 전사 62점, 레벨 3의 상단이었습니다. 문제는 개발 조직 81점과 영업·CS 40점대의 격차였습니다.
처방은 부서별 챔피언 지정과 모델 레지스트리 도입이었습니다. 흩어져 있던 프롬프트 자산과 사내 모델을 한 곳에 등록시켰습니다.
멀티 에이전트 시스템 실험도 레지스트리 등록을 조건으로 걸었습니다. AI 거버넌스 성숙도 매트릭스가 말하는 관리 단계의 최소 조건이 이 등록 습관입니다.
한 IT 기업 마케팅팀에서는 잘 쓰는 직원과 못 쓰는 직원의 간극이 위화감으로 번졌습니다. 그 조직이 저에게 요청한 건 격차 해소였고, 그건 개인기가 아니라 팀 표준을 만들어달라는 뜻이었습니다.
| 사례 | 진단에서 드러난 신호 | 이어진 의사결정 |
|---|---|---|
| A 제조 중견 (레벨 1→2) | 전사 24점 / 생산 19점·IT 58점 | 전사 공통 교육 취소, 2개 팀 파일럿 전환 |
| B 금융·서비스 (레벨 2 정체) | 거버넌스 축 6/20 최저점 | 교육 1분기 연기, 가이드라인·승인 라인 선행 |
| C IT·플랫폼 (레벨 3→4) | 부서 간 40점대 격차 | 챔피언 제도 + 모델 레지스트리 등록 의무화 |
레벨별로 반복되는 안티패턴 5가지
- 도구 구독만 늘리기: 라이선스는 300개, 주간 활성 사용자는 40명. 인프라 점수만 오르고 인력·문화 축은 그대로입니다.
- 경영진 자가진단 과대평가: 임원 응답 평균이 실무자보다 20점 이상 높으면, 그 격차 자체가 첫 번째 변화관리 과제입니다.
- 파일럿 무한 반복: 3년째 파일럿만 도는 조직이 있습니다. 확산 기준을 정하지 않은 탓이고, 이 지점은 AI 도입 정체기 극복 유형 진단으로 갈라봐야 합니다.
- 성과지표 부재: 생성형 AI 도입 6개월이 지나도 “만족도 4.3점”만 남습니다. 기준선을 안 찍었으니 비교할 숫자가 없습니다.
- 보안 이슈로 전면 차단: 사고 한 건에 전사 접속을 막고, 직원들은 개인 계정으로 넘어갑니다. 통제가 아니라 사각지대가 늘어납니다.
진단이 끝났습니다, 다음 30일과 90일에 무엇을 하나요?
레벨이 나오면 질문은 하나로 좁혀집니다. 월요일에 무엇부터 하느냐.
레벨별 다음 30일 액션 리스트
레벨 1(0~20점) 조직의 30일은 실태 파악과 최소 규칙입니다.
- 직원 AI 활용 실태 조사 결과를 요약해 사내에 공개합니다. 숨기면 개인 계정 사용이 지하로 갑니다.
- 사용 허용 도구와 계정 발급 범위를 확정합니다. 두 개면 충분합니다.
- 파일럿 부서 1곳을 점수 기준으로 선정합니다. 의욕이 아니라 데이터가 있는 부서입니다.
- 경영진 30분 브리핑으로 스폰서를 지정합니다. AI 도입 준비도 평가 결과가 그 자리의 자료가 됩니다.
- 기준선 지표 2개를 기록합니다. 보고서 작성 시간, 문의 응답 시간 정도가 무난합니다.
레벨 2(21~40점)는 흩어진 실험을 묶는 단계입니다.
- 사용 가이드라인 초안 3장을 만듭니다. 허용·금지·판단이 애매할 때 물어볼 사람까지 적습니다.
- 직무별 유스케이스 20개를 수집합니다. 부서장에게 각 3개씩 받으면 한 주면 모입니다.
- 챔피언 10명을 지정하고 이름을 공개합니다. 직급보다 실사용 빈도로 뽑습니다.
- 교육 커리큘럼을 기초·심화 2트랙으로 분기합니다. 부서 점수 격차가 그 근거입니다.
- 재진단 날짜를 캘린더에 먼저 박습니다. 6개월 뒤가 현실적입니다.
레벨 3~4(41~80점)는 표준화와 측정으로 넘어갑니다.
- 직무별 표준 커리큘럼을 정규 과정으로 편성합니다. 신입 온보딩에 포함시키면 유지 비용이 줄어듭니다.
- 모델 레지스트리와 데이터 리니지를 정비합니다. 어떤 모델이 어떤 데이터로 답하는지 추적되어야 레벨 4입니다.
- 성과지표 체계를 확정합니다. 절감 시간·품질·매출 기여 중 두 축만 골라 분기 리포트로 고정합니다.
- 사내 해커톤으로 유스케이스를 발굴합니다. 우승작은 반드시 운영 이관 담당자를 붙여 넘깁니다.
90일·6개월·12개월 로드맵 분기표
| 현재 위치 | 90일 | 6개월 | 12개월 |
|---|---|---|---|
| 레벨 1→2 | 파일럿 1개 팀 완주, 기준선 확보 | 가이드라인 배포, 2개 팀 확대 | 레벨 2 안착, 전사 리터러시 1회 |
| 레벨 2→3 | 유스케이스 20개 선별, 챔피언 가동 | 직무별 트랙 교육, RACI 확정 | 표준 프로세스 문서화, 레벨 3 판정 |
| 레벨 3→4 | 레지스트리 등록 의무화 | 부서 격차 2레벨 이내로 축소 | ROI 리포트 정례화, 최적화 진입 |
속도는 규모가 정합니다. 100인 미만은 위 표를 두 달씩 앞당길 수 있고, 1,000인 이상은 부서 편차 때문에 각 칸이 한 분기씩 밀립니다.
100~1,000인 구간이 가장 애매합니다. 전담 인력 0.5명이라도 배정되는지가 12개월 뒤 결과를 가르는 변수였습니다. 분기별 순서는 AI 도입 로드맵 수립 체크리스트로 이어서 짜면 됩니다.
한 레벨 상승에 보통 9~18개월이 걸립니다. 조급함이 파일럿을 반복하게 만듭니다.
진단 결과를 경영진 보고서 한 장으로 정리하는 법
결재하는 쪽에 앉아 교육 품의서를 승인하고 반려해본 입장에서 말하면, 임원이 보는 건 다섯 칸입니다.
- 현재 점수: 전사 평균과 5개 축 점수, 최저 축 하나를 굵게.
- 벤치마크: 동종 업계 위치. 커니의 2024 글로벌 AI 진단 같은 공개 자료가 비교선 역할을 합니다.
- 갭: 다음 레벨까지 부족한 항목 4개. 문장이 아니라 항목으로.
- 요청 예산과 기간: 교육·도구·인력을 분리해 표기. 산정 근거는 기업 AI 교육 도입 가이드의 품의 항목을 그대로 씁니다.
- 기대 효과: 6개월 뒤 재진단 목표 점수와 절감 시간 추정치 하나. AI ROI 측정 방식은 AI 도입 ROI 측정 기준선 설계와 맞춰둡니다.
이 한 장이 AI 전환 전략의 첫 페이지가 됩니다. 다만 점수가 오르는 속도는 대체로 기대보다 느리고, 그 지연 구간을 버티는 게 변화관리의 본체입니다.
설문을 돌릴 여유가 없다면 AI 성숙도 자가진단 30문항 축약본이 그 역할을 대신합니다. 축별 점수와 병목이 리포트로 나와서 보고서 배경란에 그대로 붙일 수 있습니다.
자주 묻는 질문
사내 AI 성숙도 진단은 어떻게 시작해야 하나요?
경영진 인터뷰 3건 → 부서장 전수 설문 → 실무자 표본 설문 순서로 2주면 충분합니다. 1주차에는 경영진 3~5명을 30분씩 만나 “AI로 무엇을 바꾸고 싶은지”와 예산 의사만 확인합니다. 2주차에 40문항 스코어카드를 부서장 전원과 실무자 30명 이상에게 익명으로 돌리고, 축별 평균과 부서별 편차를 함께 뽑으면 됩니다. 완벽한 표본보다 중요한 건 세 계층의 응답을 같은 문항으로 받는 일입니다.
대부분의 기업은 AI 성숙도 몇 단계에 머물러 있나요?
다수가 레벨 1~2에 정체돼 있습니다. 커니의 글로벌 AI 진단이나 국내 조사에서도 파일럿 단계를 넘어 전사 확산까지 간 조직의 비중은 크지 않게 나타납니다. 이유는 거의 같습니다. 도구는 샀는데 데이터가 정리돼 있지 않고, 가이드라인이 없어 확산 승인을 아무도 내주지 못하는 상태입니다. 레벨 2에서 3으로 넘어가는 문턱은 기술이 아니라 거버넌스 공백입니다.
AI 성숙도와 AI 거버넌스 성숙도는 어떻게 다른가요?
AI 성숙도는 활용 역량 축이고, 거버넌스 성숙도는 통제 체계 축입니다. 활용은 얼마나 잘 쓰느냐를, 거버넌스는 무엇을 쓰면 안 되는지 누가 정하고 사고가 나면 누가 책임지느냐를 봅니다. 두 축이 어긋나면 위험이 생깁니다. 활용만 높으면 그림자 AI와 민감정보 유출이, 통제만 높으면 전면 차단 상태의 정체가 따라옵니다. 데이터브릭스의 AI 거버넌스 성숙도 모델도 두 축을 분리해 평가하도록 설계돼 있습니다.
진단 결과에 따라 다음 단계로 넘어가는 데 얼마나 걸리나요?
레벨 1→2는 3~6개월, 2→3은 6~12개월이 현실적입니다. 1→2는 도구 승인과 파일럿 한 곳이면 되지만, 2→3은 가이드라인·역할 배정·표준 커리큘럼이 동시에 자리를 잡아야 하기 때문입니다. 변수는 두 가지입니다. 조직 규모와 경영진 스폰서십. 1000인 이상은 부서 편차 때문에 같은 단계라도 3개월쯤 더 걸리고, 임원이 직접 챙기는 조직은 그만큼 빨라집니다. 자세한 분기별 실행은 12개월 AI 도입 로드맵 수립 편에서 다룹니다.
교육 전 사전 진단 문항과 성숙도 진단 설문은 같이 돌려도 되나요?
같이 돌리되 섹션은 분리하는 게 맞습니다. 앞부분에 조직 진단 5개 축을, 뒷부분에 개인 역량 문항(사용 중인 도구, 주당 사용 빈도, 업무 적용 사례 유무, 검증 습관)을 배치합니다. 조직 문항은 “우리 회사는”, 개인 문항은 “나는”으로 주어를 다르게 쓰면 응답자가 헷갈리지 않습니다. 한 번에 받아두면 커리큘럼 난이도 분반과 전사 로드맵을 같은 데이터로 설계할 수 있습니다.
마무리
진단은 우리 조직을 평가하는 일이 아닙니다. 다음 한 걸음의 방향을 정하는 일입니다.
- 일괄 교육 실패의 원인은 커리큘럼이 아니라 진단 없이 시작한 순서
- 전사 평균 점수보다 축별 최저점과 부서 간 격차가 실제 병목
- 거버넌스 공백은 레벨 2에서 3으로 가는 문턱에서 반드시 드러나는 구조적 문제
- 재진단 주기 6개월, 레벨 1→2는 3~6개월이 현실적인 속도
지금 할 수 있는 첫 행동은 하나입니다. 40문항 스코어카드를 본인 기준으로 먼저 채점해보는 것.
혼자 20분이면 끝납니다. 그 점수를 부서장 두 명에게 같은 문항으로 받아보면, 경영진 인식과 실무 체감의 갭이 첫 화면에 드러납니다.
다만 여기서 막히는 지점이 있습니다. 점수가 나와도 “그래서 무엇부터 손대야 하나”가 안 보입니다. 축별 점수는 병목의 위치를 알려주지만, 그 병목을 푸는 순서까지는 알려주지 않습니다.
한 IT 기업 마케팅팀에서 받은 요청이 그랬습니다. 잘 쓰는 직원과 못 쓰는 직원의 간극이 벌어지자, 그건 생산성 문제가 아니라 위화감이라는 조직 문제가 됐습니다. 점수만으로는 이 문제를 어디서부터 풀지 정하기 어렵습니다.
체크리스트는 증상이 몇 개인지까지 세어줍니다. 정밀 진단은 몇 점이고, 어느 차원이 막혔고, 앞으로 90일간 무엇을 할지까지 갑니다. AMI 점수(200~1,000점)와 3계층 8차원 차트, 그림자 AI형·정체 표류형 같은 조직 유형 8종 판정, 병목 차원의 30/60/90일 로드맵이 제출 즉시 웹 리포트로 나옵니다. 설문 돌릴 시간이 없는데 다음 주 임원 보고에 현황 숫자를 넣어야 하는 상태라면 이쪽이 빠릅니다. 이메일을 남기면 같은 리포트를 메일로도 받아 품의서에 그대로 첨부할 수 있습니다.
17문항 5분 정밀 진단 — AMI 점수·조직 유형·병목 차원·90일 로드맵 리포트 받기 (품의서 첨부용)
진단 다음 단계인 목표 설정·커리큘럼 설계·성과 측정까지 이어서 보려면 사내 AI 교육 완전 가이드: 진단부터 성과 측정까지 8단계 실행법에서 전체 흐름을 확인할 수 있습니다. 부서별 적용은 AI 업무 활용 편이, 금융·의료·제약처럼 검토 절차가 긴 조직은 규제산업 AI 도입 편이 이어지는 자리입니다.
이 내용을 우리 회사 상황에 맞춰 이야기하고 싶다면 — 문의를 남겨 주세요. 24시간 안에 대표가 직접 답하고, 문의하신 분께는 전자책 《우리 회사 AI는 왜 2단계에서 멈췄을까》를 무료로 드립니다. 먼저 보고 결정하고 싶다면 다음 무료 라이브 특강을 예약해 두세요. 날짜가 잡히면 가장 먼저 알려드립니다.