「독자 AI 파운데이션 모델」 프로젝트로 확보한 AI 학습용 데이터 29종 본격 개방
과학기술정보통신부가 2026-08-27 공개한 자료를 바탕으로 「독자 AI 파운데이션 모델」 프로젝트로 확보한 AI 학습용 데이터 29종 본격 개방의 주요 내용을 독자가 바로 확인할 수 있게 정리했습니다.
무엇을 발표했나
과학기술정보통신부(부총리 겸 과학기술정보통신부 장관 배경훈, 이하 ‘과기정통부’)와 한국지능정보사회진흥원(원장 김형철, 이하 ‘NIA’)은 「독자 AI 파운데이션 모델」 프로젝트 5개 정예팀*이 1차 단계평가 과정에서 확보한 총 29종(약 3,544만건, 약 1.56조 토큰 규모)의 데이터를 AI허브 누리집(aihub.or.kr)에 공개한다고 밝혔다.
핵심 내용
- 컨소시엄 별 주관기관(가나다順) : 네이버클라우드, 업스테이지, 에스케이텔레콤, 엔씨에이아이, 엘지경영개발원 AI연구원(이하 엘지AI연구원) ■ 정예팀별 AI개발 노하우가 담긴 대규모 AI학습 데이터 개방 이번 개방 데이터는 정예팀이 각자의 개발 전략에 맞춰 기획하여 데이터 구축·가공 예산(’25년, 150억원)을 통해 확보한 데이터로, 사전학습에 필요한 대규모 데이터셋부터 영상·음성 등 멀티모달, 안전성 확보를 위한 레드티밍 데이터 등으로 구성되어 있다.
- 토큰으로 환산하면 약 1.56조 토큰(추정)에 달하며 이론적으로 약 70~80B 수준의 대형AI모델 학습에 사용될 수 있는 규모이다.
- 먼저, 네이버클라우드는 공개 영상 234만건과 방송 영상 52만건, 해당 영상클립 기반의 텍스트 1,550만 건과 음성 질의응답 1,200만 건을 함께 구축하였다.
- 텍스트는 장면을 문장 단위로 기술한 캡션 등으로 구성되어 AI모델의 영상 이해능력 학습과 이미지 생성 모델 학습에 활용될 수 있
숫자와 현장 정보
- 발표 기관: 과학기술정보통신부
- 발표일: 2026-08-27
- 확인할 원문: 「독자 AI 파운데이션 모델」 프로젝트로 확보한 AI 학습용 데이터 29종 본격 개방
배경과 의미
과학기술정보통신부(부총리 겸 과학기술정보통신부 장관 배경훈, 이하 ‘과기정통부’)와 한국지능정보사회진흥원(원장 김형철, 이하 ‘NIA’)은 「독자 AI 파운데이션 모델」 프로젝트 5개 정예팀*이 1차 단계평가 과정에서 확보한 총 29종(약 3,544만건, 약 1.56조 토큰 규모)의 데이터를 AI허브 누리집(aihub.or.kr)에 공개한다고 밝혔다.
컨소시엄 별 주관기관(가나다順) : 네이버클라우드, 업스테이지, 에스케이텔레콤, 엔씨에이아이, 엘지경영개발원 AI연구원(이하 엘지AI연구원)
원문에서 함께 볼 부분
- 예산이나 지원 규모가 언급된 경우에는 실제 대상, 금액 산정 방식, 다른 제도와의 관계가 원문에 명시됐는지 확인하면 좋습니다.
- 대상이 특정된 발표는 개인, 기업, 기관 가운데 누구에게 직접 적용되는 내용인지 구분해 읽는 편이 안전합니다.
- 원문 핵심 문장으로는 '과학기술정보통신부(부총리 겸 과학기술정보통신부 장관 배경훈, 이하 ‘과기정통부’)와 한국지능정보사회진흥원(원장 김형철, 이하 ‘NIA’)은 「독자 AI 파운데이션 모델」 프로젝트 5개 정예팀*이...' 부분을 함께 확인합니다.
원문
맥락 짚기
과학기술정보통신부 관련 발표는 제목의 결론보다 대상, 시행 시점, 담당 기관의 후속 안내를 함께 봐야 맥락이 분명해집니다.
- 발표일과 실제 적용일이 다를 수 있어 날짜 표현을 따로 봅니다.
- 개인, 사업자, 기관 중 누구에게 직접 영향을 주는 내용인지 구분합니다.
- 신청, 단속, 지원, 설명자료 중 어느 단계의 소식인지 확인합니다.
본문은 원문과 보조 참고 자료 3개를 대조해 읽을 수 있게 정리했습니다.
참고 자료
본문은 아래 원문과 공개 자료를 기준으로 편집했습니다. 날짜, 신청 조건, 운영 여부처럼 바뀔 수 있는 정보는 원문에서 다시 확인하세요.
편집 기준
공식 발표를 그대로 옮기기보다 독자가 확인해야 할 대상, 시점, 절차, 후속 확인 경로를 중심으로 다시 정리했습니다.