티스토리 뷰

카테고리 없음

생성형 AI 도입 전 기업이 반드시 준비해야 할 데이터 관리 체계

qweasd1 2026. 10. 9. 07:20

목차


    생성형 AI를 기업 업무에 적용하려는 움직임이 빠르게 확산되고 있다. 문서 요약, 보고서 작성, 고객 상담, 사내 지식 검색, 개발 지원 등 적용할 수 있는 영역도 넓다. 그러나 기업이 생성형 AI를 실제 업무에 연결하려면 모델이나 서비스 선정에 앞서 확인해야 할 것이 있다. 바로 AI가 사용할 데이터의 관리 체계다.

    기업 데이터 저장소와 접근통제, 개인정보 보호, 데이터 품질 및 수명주기 관리 체계가 연결

    생성형 AI는 데이터와 분리해서 생각하기 어렵다. 사용자가 프롬프트에 입력하는 정보뿐 아니라 사내 문서, 데이터베이스, 지식관리시스템, 업무 시스템의 데이터를 검색증강생성(RAG)이나 API로 연결할 수도 있다. 데이터의 출처와 권한, 품질, 개인정보 포함 여부가 제대로 관리되지 않은 상태에서 AI의 접근 범위부터 확대하면 기존 데이터 관리 문제까지 AI를 통해 증폭될 수 있다.

    따라서 기업의 생성형 AI 도입은 단순한 AI 솔루션 구축 프로젝트가 아니라 데이터 거버넌스와 정보보호 체계를 함께 점검하는 프로젝트로 접근할 필요가 있다.

    생성형 AI에서 데이터 관리가 중요한 이유

    일반적인 업무 시스템에서는 사용자가 필요한 시스템에 접속하고 권한이 허용된 데이터를 직접 조회한다. 생성형 AI를 사내 데이터와 연결하면 구조가 달라질 수 있다. 사용자는 자연어로 질문하고 AI는 여러 데이터 소스를 검색하거나 전달받은 정보를 바탕으로 결과를 생성한다. 이 과정에서 사용자가 원본 데이터의 위치나 처리 과정을 직접 확인하지 못할 수도 있다.

    예를 들어 사내 AI 검색 시스템이 인사규정, 계약서, 기술문서, 회의자료를 하나의 검색 영역으로 구성했다고 가정해 보자. 원본 시스템에서는 각각 접근권한이 구분되어 있었더라도 AI 검색 계층에서 권한이 제대로 연계되지 않으면 사용자가 원래 볼 수 없었던 문서의 내용을 검색 결과나 답변을 통해 확인할 가능성이 생긴다.

    결국 생성형 AI 환경에서는 “AI가 어떤 데이터를 학습했는가”뿐 아니라 “어떤 데이터에 접근할 수 있는가”, “누가 질문했는가”, “어떤 정보가 AI에 전달되는가”, “생성 결과를 어디까지 사용할 수 있는가”를 함께 관리해야 한다.

    먼저 기업 데이터의 위치와 소유자를 파악해야 한다

    AI 도입 전에 가장 먼저 필요한 작업은 데이터 인벤토리를 만드는 것이다. 기업의 데이터는 ERP나 CRM 같은 핵심 업무 시스템에만 존재하지 않는다. 파일 서버, NAS, 그룹웨어, 이메일, 협업 도구, 개인 PC, 클라우드 스토리지 등 다양한 위치에 분산될 수 있다. 동일한 문서가 여러 장소에 복제되어 있거나 관리 책임자가 명확하지 않은 경우도 많다.

    최소한 다음 항목은 파악할 필요가 있다.

    • 데이터가 저장된 위치와 시스템
    • 데이터의 업무 목적
    • 데이터 소유 부서와 관리 책임자
    • 개인정보 및 민감정보 포함 여부
    • 기밀성 등급
    • 접근 가능한 사용자와 조직
    • 보존기간과 파기 기준
    • AI 학습·검색·분석에 사용할 수 있는지 여부

    이 과정이 필요한 이유는 모든 사내 데이터가 AI에 연결하기 적합한 데이터는 아니기 때문이다. 오래된 자료, 중복 문서, 작성자가 불분명한 파일, 보존기간이 지난 개인정보, 접근권한이 잘못 설정된 자료까지 AI 검색 대상에 포함하면 AI의 편의성은 높아질 수 있어도 정보보호와 결과 신뢰성은 오히려 떨어질 수 있다.

    데이터 분류 기준과 AI 사용 가능 범위를 연결해야 한다

    기존 정보보호 체계에서는 데이터를 중요도에 따라 일반, 사내한, 대외비, 기밀 등으로 구분하는 경우가 많다. 생성형 AI를 도입할 때는 여기에 AI 사용 가능 여부를 연결하는 방식이 효과적이다.

    예를 들어 공개자료와 일반 업무자료는 승인된 기업용 AI에서 사용할 수 있도록 하고, 개인정보가 포함된 자료는 별도의 조건을 적용할 수 있다. 영업비밀이나 핵심 기술자료는 외부 AI 서비스 입력을 금지하고 내부 구축형 AI에서도 별도의 승인 절차를 적용하는 방식이다.

    중요한 것은 “생성형 AI 사용 금지”라는 하나의 규칙만 만드는 것이 아니다. 데이터 유형과 AI 서비스 형태에 따라 허용 범위를 구체적으로 정의해야 실제 업무에서 적용할 수 있다. 특히 외부 생성형 AI, 기업용 SaaS AI, 사내 구축형 AI, RAG 기반 사내 검색 서비스는 데이터 처리 구조가 서로 다르다. 따라서 서비스별로 입력 데이터의 저장 여부, 모델 학습 활용 여부, 보존기간, 데이터 처리 위치, 삭제 방법 등을 확인하고 데이터 분류 정책과 연결해야 한다.

    접근권한은 원본 시스템의 권한을 그대로 반영해야 한다

    RAG 기반 사내 AI를 구축할 때 자주 놓치는 부분이 접근통제다. RAG는 사용자의 질문과 관련된 사내 문서를 검색한 뒤 그 내용을 생성형 AI에 전달해 답변을 만드는 방식이다. 이때 AI가 검색하는 데이터 저장소에 모든 문서를 한꺼번에 적재하면서 기존 시스템의 권한정보를 제거하면 문제가 발생할 수 있다.

    사용자 권한을 먼저 확인한 뒤 허용된 사내 문서만 RAG 검색과 생성형 AI 답변에 활용하는 접근통제

    따라서 문서를 AI 검색용 저장소나 벡터 데이터베이스로 이동할 때도 원본의 사용자·조직·역할 기반 접근권한을 유지할 수 있어야 한다. 사용자가 질문하면 먼저 사용자 권한을 확인하고, 해당 사용자가 열람할 수 있는 데이터 범위 안에서만 검색 결과를 AI에 제공하는 구조가 필요하다.

    관리자라고 해서 모든 AI 대화 내용과 검색 데이터를 무조건 볼 수 있도록 설계하는 것도 바람직하지 않다. 운영에 필요한 관리자 권한 역시 최소권한 원칙에 따라 구분해야 한다.

    데이터 품질도 AI 품질의 일부다

    생성형 AI 프로젝트에서는 모델 성능에 관심이 집중되기 쉽지만 사내 데이터의 품질 역시 결과에 직접적인 영향을 준다. 예를 들어 사내 규정의 개정 전 버전과 최신 버전이 동시에 검색되면 AI가 오래된 규정을 근거로 답변할 수 있다. 동일한 업무 절차가 여러 문서에 서로 다르게 기록되어 있어도 비슷한 문제가 발생한다.

    따라서 AI에 데이터를 연결하기 전에 중복 문서 제거, 최신 버전 식별, 데이터 형식 표준화, 문서 소유자 지정, 오류 데이터 수정 등의 작업이 필요하다. 특히 업무 의사결정에 AI 결과를 활용하려면 답변만 보여주는 것보다 어떤 문서와 데이터를 근거로 결과를 생성했는지 확인할 수 있는 구조를 만드는 것이 중요하다.

    개인정보는 AI 생애주기 전체에서 관리해야 한다

    생성형 AI에서는 개인정보가 여러 단계에서 처리될 수 있다. 학습 데이터에 개인정보가 포함될 수 있고, 사용자가 프롬프트에 고객이나 직원 정보를 입력할 수도 있다. RAG 검색 과정에서 개인정보가 포함된 문서가 AI에 전달될 수도 있으며 생성 결과에 개인정보가 다시 나타날 가능성도 있다.

    개인정보보호위원회는 2025년 발표한 「생성형 인공지능(AI) 개발·활용을 위한 개인정보 처리 안내서」에서 생성형 AI의 생애주기를 고려해 개인정보 처리 기준과 안전조치를 제시했다. 기업 입장에서는 AI 프로젝트를 시작한 뒤 개인정보 문제를 별도로 해결하기보다 기획 단계부터 개인정보 처리 목적과 데이터 출처, 법적 근거, 보호조치를 함께 검토하는 것이 효율적이다.

    특히 외부 생성형 AI 서비스를 업무에 사용할 경우 직원이 프롬프트에 어떤 정보를 입력할 수 있는지 명확하게 안내해야 한다. 기술적 통제가 가능한 경우 민감정보나 중요정보의 입력을 탐지하거나 제한하는 방안도 검토할 수 있다.

    AI 데이터의 흐름을 기록할 수 있어야 한다

    기존 시스템에서는 데이터가 어디에 저장되어 있는지가 중요했다면 AI 환경에서는 데이터가 어떻게 이동하고 사용되는지도 중요하다.

    기업은 가능하면 사용자 → AI 서비스 → 검색 시스템 → 사내 데이터 → 모델 → 생성 결과의 흐름을 추적할 수 있어야 한다. 여기에는 사용자가 입력한 프롬프트, 검색된 데이터, 모델에 전달된 컨텍스트, 생성 결과, 외부 시스템으로 전송된 정보 등이 포함될 수 있다.

    모든 내용을 무조건 장기간 저장해야 한다는 의미는 아니다. 오히려 개인정보와 중요정보가 로그에 다시 축적될 수 있으므로 기록 목적과 보존기간, 접근권한을 함께 설계해야 한다. 사고가 발생했을 때 어떤 사용자가 어떤 AI 서비스를 이용했고 어떤 데이터가 처리되었는지 확인할 수 없다면 원인 분석과 영향 범위 파악이 어려워진다.

    데이터 수명주기와 AI 수명주기를 함께 관리해야 한다

    AI에 연결된 데이터도 생성, 이용, 변경, 보관, 파기의 수명주기를 가진다. 문제는 원본 데이터가 삭제됐는데 AI 검색용 인덱스나 캐시에 데이터가 남아 있는 경우다. 원본 문서의 권한이 변경됐지만 벡터 데이터베이스의 권한정보가 갱신되지 않는 문제도 발생할 수 있다.

    기업 데이터의 수집·분류·검증·AI 활용·변경·보관·삭제가 AI 검색 저장소와 함께 관리되는 데이터 수명주기

    따라서 원본 시스템에서 데이터가 수정·삭제되거나 접근권한이 변경되면 AI 시스템에도 이를 반영하는 동기화 절차가 필요하다. AI 프로젝트에서 데이터 파기는 단순히 원본 파일을 삭제하는 것으로 끝나지 않을 수 있다. 검색 인덱스, 임시 저장소, 로그, 백업, 외부 AI 서비스의 보존 데이터 등 데이터가 남을 수 있는 위치를 함께 확인해야 한다.

    실무에서는 AI보다 데이터 정리가 먼저일 수 있다

    정보보호와 IT 운영 관점에서 보면 생성형 AI 도입 과정에서 가장 어려운 문제는 AI 모델 자체가 아닐 가능성이 높다. 기존 데이터의 소유자가 불명확하고 접근권한이 오래 방치되어 있으며 문서 분류 기준이 제대로 적용되지 않은 기업이라면 AI를 연결하는 순간 기존 관리 문제도 함께 드러난다.

    예를 들어 “전사 문서를 AI로 검색할 수 있게 하자”는 요구는 기술적으로는 검색 시스템 구축 문제처럼 보인다. 하지만 실제로는 어떤 문서를 전사 직원이 볼 수 있는지, 퇴직자 자료는 남겨야 하는지, 개인정보가 포함된 문서는 어떻게 처리할지, 문서별 책임 부서는 어디인지 결정해야 한다. 이런 문제는 AI 솔루션만으로 해결하기 어렵다.

    그래서 생성형 AI 프로젝트의 선행 작업으로 데이터 인벤토리와 분류, 소유자 지정, 접근권한 정비를 진행하는 것이 중요하다. 처음부터 모든 데이터를 완벽하게 정리하려 하기보다는 AI 적용 대상 업무를 선정하고 해당 업무에 필요한 데이터부터 정비하는 방식이 현실적이다.

    생성형 AI 도입 전 데이터 관리 체크포인트

    1. AI가 사용할 데이터의 위치와 소유자가 파악되어 있는가
    2. 데이터별 중요도와 개인정보 포함 여부가 분류되어 있는가
    3. AI 서비스별 입력 가능한 데이터 기준이 정의되어 있는가
    4. 외부 AI 서비스의 저장·학습·보존 정책을 확인했는가
    5. RAG 검색 권한이 원본 시스템의 접근권한과 연계되는가
    6. 오래되거나 중복된 데이터를 AI가 참조하지 않도록 관리하는가
    7. 개인정보 처리 목적과 보호조치가 검토되어 있는가
    8. AI를 통한 데이터 이용 기록을 필요한 범위에서 추적할 수 있는가
    9. 원본 데이터의 변경·삭제가 AI 검색 데이터에도 반영되는가
    10. 사고 발생 시 AI 관련 데이터 흐름을 추적할 수 있는가

    마무리

    생성형 AI의 성능은 좋은 모델을 선택하는 것만으로 결정되지 않는다. 기업 내부의 어떤 데이터를 어떤 권한으로 연결하고, 데이터의 정확성과 최신성을 어떻게 유지하며, 개인정보와 중요정보를 어떻게 보호할 것인지가 실제 서비스 품질과 위험 수준을 함께 결정한다.

    특히 기업 내부 데이터를 생성형 AI와 연결하는 단계에서는 기존에 보이지 않던 데이터 관리 문제가 한꺼번에 드러날 수 있다. 따라서 AI 도입을 데이터 관리 체계를 점검하는 계기로 활용할 필요가 있다.

    생성형 AI 도입의 출발점은 AI 모델이 아니라 데이터일 수 있다. 데이터의 위치, 소유자, 분류, 접근권한, 품질, 수명주기를 먼저 정리한 기업일수록 AI를 더 안전하고 지속적으로 업무에 활용할 수 있다.

    참고자료/출처

    1. NIST - AI Risk Management Framework
    2. NIST - Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
    3. 개인정보보호위원회 - 생성형 인공지능(AI) 개발·활용 위한 개인정보 처리 기준
    4. OECD - AI, data governance and privacy
    5. EUR-Lex - EU Artificial Intelligence Act