소프트웨어

솔트룩스, 국립국어원 말뭉치 구축 사업 수주

백지영

[디지털데일리 백지영기자] 솔트룩스(대표 이경일)는 국립국어원의 ‘구어 자료 수집 및 원시 말뭉치 구축 사업’을 수주했다고 12일 밝혔다.

현재 주요 국가 공공 데이터세트 현황을 살펴보면 미국 25만2952건, 캐나다 8만1949건, 영국 5만1297건에 달한다. 이에 비해 한국은 2만9934건으로 미국의 1/9 수준이다. 특히 언어 데이터인 말뭉치 어절 보유량을 살펴보면 영어 2000억 어절, 중국어 800억 어절 대비 한국어 2억 어절로 영어의 1/1000에 불과하다.

이에 국립국어원은 TV, 라디오 등의 구어 원자료와 드라마, 연극 대본 등의 준구어 원자료를 수집하여 말뭉치를 구축하고, 저작권 이용 계약까지 체결하는 말뭉치 구축 사업을 추진한다.

솔트룩스는 이미 지난해 자체 말뭉치 구축 전문인력을 통해 품질순도 99.9%의 국립국어원 ‘국어 말뭉치 연구 및 구축 사업’을 수행한 경험이 있다. 이를 바탕으로 인공지능(AI) 산업 발전을 위한 대규모 고품질 우리말 자원 구축을 진행할 예정이다.

솔트룩스 이경일 대표는 “자체 보유한 AI 원천 기술력과 AI 서비스 개발 경험을 통해 성공적으로 사업을 수행하겠다”고 강조했다.

<백지영 기자>jyp@ddaily.co.kr

백지영
jyp@ddaily.co.kr
기자의 전체기사 보기 기자의 전체기사 보기
디지털데일리가 직접 편집한 뉴스 채널