[단독] 독파모 '시험문제'도 주먹구구…주관사만 바꾸고 '업체 돌려막기'

오수진 기자 (ohs2in@dailian.co.kr)

입력 2026.10.05 10:00  수정 2026.10.05 10:00
G 구글 검색 선호 출처로 추가 ↗

지식·장문이해 분야, 사실상 동일 컨소시엄

특정 업체 서로 다른 평가 데이터셋 반복 참여

직원 한 자릿수에 연매출 수억…전문성 검증 했나

김장겸 "고등학생이 대학원생 문제 출제한 격"

김장겸 국민의힘 의원 ⓒ데일리안 홍금표 기자

정부의 '독자 AI 파운데이션 모델' 평가용 데이터셋 구축사업에서 주관사만 바꾼 사실상 동일 컨소시엄이 서로 다른 평가 분야를 맡은 것으로 확인됐다. 모델 간 우열을 가리고 '국가대표 AI'를 선발할 '시험문제'를 만드는 핵심 사업에서 정부가 분야별 전문성과 수행 역량을 충분히 검증했는지에 대한 의문이 평가 전반의 신뢰도 논란으로 번질 수 있다는 지적이 나온다.


5일 국회 과학기술정보방송통신위원회 소속 김장겸 국민의힘 의원이 과학기술정보통신부로부터 제출받은 자료에 따르면, 2025년 NIA의 AI 모델 데이터셋 구축사업 가운데 '지식'과 '장문이해' 분야는 주관사만 바뀌었을 뿐 참여기관 구성이 완전히 동일했다.


구체적으로 지식 분야는 B사가 주관하고 C사·D사·E기관이 참여했으며, 장문이해 분야는 C사가 주관하고 D사·B사·E기관이 참여했다. B사와 C사가 주관사와 참여사 역할만 서로 바꿨을 뿐 4개 기관이 그대로 두 분야를 수행한 셈이다.


특정 업체의 반복 참여는 올해에도 이어졌다. 2025년 지식과 장문이해'에 참여했던 B사와 D사는 2026년 '사회적안전성' 데이터셋 사업에도 다시 참여했다. 2025년 '수학' 분야를 주관했던 A사 역시 2026년에는 '지시이행' 분야 주관사와 '한국어' 분야 참여사로 동시에 이름을 올렸다.


독파모 평가에서 데이터셋은 사실상 AI 모델이 풀어야 할 시험문제와 채점기준 역할을 한다. 따라서 데이터셋 구성은 단순 용역 문제가 아니라, 국가대표 AI 평가의 공정성과 신뢰도에 직접 영향을 미치는 요소다. 어떤 문제를 선정하고 정답과 배점을 어떻게 설계하느냐에 따라 모델 간 우열과 최종 선발 결과가 달라질 수 있단 점에서다.


하지만 국가대표급 AI 모델을 평가하는 벤치마크 데이터셋을 구축하는 기관들의 전문성과 역량이 충분히 검증됐는지를 두고도 의문이 제기된다.


김장겸 의원실이 공개 기업정보를 확인한 결과, 2025년 수학 분야 주관사인 A사는 2025년 매출 약 1억 5000만원, 직원 8명 규모였고 지식 분야 주관사인 B사는 직원 6명에 매출 10억원 안팎, 장문이해' 분야 주관사인 C사는 2025년 매출 약 6억원, 직원 7명 규모로 나타났다.


기업의 규모나 매출이 바로 기술력을 의미하는 것은 아니지만, 국내 최고 수준의 AI 기업들을 평가하는 '시험문제'를 만드는 사업인 만큼 참여업체가 충분한 AI 전문인력과 모델 평가 경험 등 역량을 갖추고 있는지 의문이라는 지적이다.


김장겸 의원은 "주관사 이름만 바꾼 사실상 동일 컨소시엄이 서로 다른 평가 분야를 맡고, 일부 주관기업은 공개 기업정보상 직원이 한 자릿수에 불과한 것으로 나타났다"며 "정부가 직접 '국가대표 AI'를 선발하겠다고 하면서 시험문제부터 주먹구구식으로 만든다면 평가 결과에 대한 신뢰 역시 흔들릴 수밖에 없다"고 말했다.


독자 AI 파운데이션 모델 평가용 데이터셋 구축사업 참여 현황 ⓒ국민의힘 김장겸 의원실

0

0

기사 공유

댓글 쓰기

오수진 기자 (ohs2in@dailian.co.kr)
기사 모아 보기 >
관련기사

댓글

0 / 150
  • 최신순
  • 찬성순
  • 반대순
0 개의 댓글 전체보기