네이버 AI 중국산 표절 논란? 국대 AI 탈락 논란? 핀트가 좀 어긋난 논란 주저리...
이번에 국대 AI를 뽑는 과정 중에 네이버가 독창성인지 독자성인지 모를 기준으로 탈락했다고 한다.
안타깝지만, 경선 주제에 맞지 않는 무언가를 했으니 떨어졌겠지.
이 이야기에 대해 조금 알아보자. 그리고 사람들이 왜 그에 대해 분노 (주로 유튜브 댓글 등지에서) 하고 있는지, 그리고 어떤 핀트가 어긋난 분노를 하고 있는지에 대하여.
복잡한 게 읽기 싫다면 결론으로 내리면 된다.
1. 독자 개발 기준 미달? 우선은 AI의 구조부터
우선, 이 '독자 개발' 이라는 단어가 도대체 뭘 말하는지부터 알아보자.
지금 이 이슈에서 이야기하는 부분을 쉽게 이해하려면 아무래도 AI의 특징 중 몇개를 골라 설명해야 하는데, 최대한 쉽게 설명해보겠다.
일단, 아키텍쳐(구조).
현대 AI는 대부분 (크게 보았을 때) 비슷한 구조를 가지고 있는데, 가장 간단한 구조로 치환해서 설명하면 대충 이런 구조가 된다.

왼쪽에서 입력을 받고, Node 1와 Node 2라는 알 수 없는 함수에 의해 값이 변환된 다음, 최종적으로 오른쪽 출력으로 나온다.
이걸 조금 복잡하게 늘리면,

이런 식으로 노드와 화살표 (값이 전달되는 방향) 을 더 구성하여 조금 더 복잡한 구조의 AI를 구성할 수 있는 거다.
그러니까, 아키텍쳐는 데이터의 흐름이 어떻게 진행될 지, 그 청사도를 미리 깔아둔다고 생각하면 좋다.
그러면, 네이버가 베꼈다는 '가중치'는 뭘까?
다시 위로 돌아가 이미지를 살펴보자.

가장 간단한 예시를 다시 가져왔는데, 예를 들어 한국어를 넣고 영어로 변환하는 일을 이 AI가 한다고 가정해 보자.
그렇다면 각 노드가 하는 일을 이렇게 정의할 수 있을 거다.

1번 노드에서 한국어를 뜻으로 전환하고, 2번 노드는 그 뜻을 전달받아 그걸 다시 영어로 변환한다.
뭐, 실제 AI가 이렇게 일하진 않지만 (저 변환 과정에 엄청나게 많은 노드들이 보통 존재한다), 일단 축약해서 그렇다고 치고, 그렇다면 각 노드마다 무엇을 어떻게 변환해야 되는지 저장이 되어 있을 거다.
예를 들어,
나무 -> 줄기와 가지와 뿌리가 있고 가지에 잎이 달리며 때가 되면 꽃이 피는 여러해살이 식물
물고기 -> 물속에 살며 지느러미로 헤엄치고 아가미로 호흡하는 척추동물
숫자 -> 수를 나타내는 글자
대충 이런 식으로 뭔가 데이터가 들어왔을 때 어떻게 작용하는지에 대한 방식이 학습 과정을 통해 저장이 되는데, 이를 '가중치'라 부른다.
그렇다면 이 가중치를 네이버는 왜 베꼈을까?
아니, 베낀 것이 맞을까?
이 부분이 사람들이 가장 많이 분노하고 있는 부분이자, 오해하고 있는 부분이다.
2. 가중치를 표절한다는 말이 맞을까?
AI를 배우고, 또 관련 일을 하다 보면 참 많은 일...을 하게 되는데. 놀랍게도 그 중 대부분은 머리를 싸매거나 대기하는 시간이다.
왜냐하면 보통 학습을 돌려놓고 학습이 잘 돌아가는지 모니터링(...) 하는 시간이 제일 오래 걸리기 때문인데...
이를 보통 해결하기 위해, 양질의 데이터로 미리 일정 수준 학습 시켜놓은 모델들이 보통은 배포되고 있다.
예를 들어, 일개 개인이 어디 영국 도서관에 있는 모든 글을 수집해 글쓰는 AI를 학습시키는 건 엄청난 자원과 시간이 필요하겠지만, 이미 누군가가 좋은 컴퓨터로 해당 학습을 돌려 모델을 허깅페이스에 업로드해놓을 수 있다.
그럼 이제 누군가, 특히 학생들이 해당 모델을 보고, 어디까지 사용 가능한지 (보통 명시되어 있다)를 체크하고, 그 다음에 모델을 통채로 가져다 쓸 건지, 아니면 가중치만 가져다가 쓸 건지를 결정하면 된다.
그리고 (그걸 그대로 가져다 쓰면 당연히 0점이 나올 것이기 때문에) 해당 모델의 아키텍쳐 (아까 말한 구조) 를 발전시켜 추가 학습을 돌리거나, 새로운 데이터를 가져다가 있는 모델에 추가 학습을 시켜 전체적인 데이터가 아닌, 개인이 가지고 있는 자료와 목적에 맞춰 AI를 조정할 수 있다. (흔히들 파인튜닝이라 부르는 것이 이것이다)
그러므로, 사실상 가중치를 표절했다....라는 말은 맞지 않다.
그냥 가져다 쓸 수 있게 누군가가 올려둔 자료를 가져다가 쓴 것 뿐.
업무의 효율성과, 모델을 기초부터 다시 작성해야 하는 (시간과 자원을 엄청 먹는다) 수고를 위해서라도 보통은 그런 자료들을 가져다가 쓰는 것이 좋을 수밖에.
특히나 비젼 부문에서는 중국이 압도적인 강세를 보이는 분야인지라...
이에 대해 짧게 설명하면, AI의 질은 데이터 양과 모델 구조(아키텍쳐)에서 오는데, 구조는 둘째치더라도 중국은 어마무시한 양의 비젼 데이터를 가지고 있다. 왜냐면 전국민을 CCTV로... 음. 여기까지만 하겠다.
아무튼.
실제로 AI 공부를 하고 있는 내 입장에서는, 네이버는 분명 '독자 개발하세요' 라는 소리를 듣고,
"아, 아키텍쳐 새로 짜고... 가중치는 이거 써볼까? 어라? 뭐 더 학습시켜도 오히려 정확도가 안 오르고 내려가네? 그냥 쓰는게 제일 정확도가 높겠다."
하고 안일하게 생각했다가 뒤통수를 맞았을 확률이 높다는 거다.
실제로 독자 개발하는 수많은 AI들이 이미 pre-learning (전처리 학습인가, 전학습인가, 한국어론 잘 모른다. 아무튼 모델, 특히 수많은 데이터를 사용해야 하는 학습이 필요한 모델들의 학습을 미리 진행해서 모델로 만들어 둔 것) 을 이용해서 독자적인 변형을 만들고 있으므로 해당 사안에 대해 그리 크게 생각하지 않았을 가능성이 있지 않을까... 라고 생각한다는 것.
고로, 아예 처음부터 '독자 개발. 가중치 가져오지 마세요. 모델 구조 베끼지 마세요.' 라고 조건을 정확히 명시했으면 일어나지 않았을 일이라는 거다.
네이버건, 주최 측이건 둘 다 문제가 있는 셈.
3. 그렇다면 가져온 가중치에 문제는 없을까?
사실, 여기가 본론이라 해도 과언이 아니다.
사람들은 네이버가 뭘 베꼈는가에 대해서는 관심이 좀 없고, 그게 '중국' 것이라는 사실에 조금 더 분노한 것처럼 보인다... 가 내 첫 감상이었는데, 실제로 문제는 없을까?
뭐, 본론부터 말하자면, 없을 가능성이 높다.
백도어가 있지 않을까... 누가 감시하는 거 아니냐... 등등 말은 많은데, 애초에 모델에 그런 무언가가 들어가기 참 쉽지 않다는 것을 둘째 치더라도, 보통 그런 추가적인 '프로그램' 이 들어가 있다면 그냥 다운받는 즉시 보안부서나 기타 유사 부서들이 알아차렸을 거다.
다시 말하지만, 모델은 학습을 어떻게 하는지, 학습한 모델이 어떤지를 저장해놨을 뿐.
기타 기능들이 들어갈 구석이 없다.
진짜로, 전혀.
유일한 가능성이라고 하면, 중국에서 개발한 모델답게 특정 어구나 내용이 검열되도록 모델이 조정되었을 가능성...인데.
하지만, 딥시크 사례를 보면 알 수 있듯, 그걸 유저, 즉 사용자가 우회하는 경우가 왕왕 생긴다는 건, 마찬가지로 모델을 조금만 조정하면 해당 규제가 마치 없던 것처럼 학습시킬 수 있기에 딱히 문제가 되진 않을 거다.
간단하게 설명했지만, 조금 더 들어가면 추가 학습을 어떤 데이터로 시키느냐에 따라서 모델의 추론이나 행동 양상은 그만큼 쉽게쉽게 변화한다.
심지어 얼마나 변화할지도 개발자들이 조정할 수 있고...
4. 모델 구조 베끼는 건?
위에서 잠깐 이야기했는데, 모델의 성능은 모델 구조와 학습 데이터의 양과 질이 가장 크게 좌우한다.
그렇다면, 모델 구조를 베꼈다고 여겨지는 다른 몇몇 참가자들에겐 문제가 있어야 되는게 아닌가?
라는 말이 나오기도 했다.
솔직히, 엄밀히 따지자면, 동일 구조를 베꼈다면 문제가 있는게 맞긴 하다...
모델 구조가 동일한 AI 모델은 같은 데이터에 학습시켰을 때 동일한 학습을 보통 진행하게 되기 때문인데...
뭐 가중치를 초기화해서 다른 결과가 나오는 거 아니냐고 물어본다면, 아니라고 대답하겠다. 어디까지나 같은 데이터라는 가정 하에.
가중치 초기화 후 '다른' 결과의 모델값이 나왔다면, 보통 높은 확률로 그 모델의 제작자가 올린 최종 학습 모델보다 정확도가 떨어질 가능성이 높거든...
고로 해당 모델 구조에서 동일한 데이터쌍에서 나오는 최종 모델은 결과적으로 비슷할 수밖에 없다.
물론, 이번 경선에서 나온 유사 모델 구조들을 보면, 완전히 동일한 구조도 아니고, 결과적으로 다른 데이터를 이용해 학습시켰다는 것으로 독자성을 인정받긴 했다.
실제로 다른 데이터를 이용했다면 다른 최종 모델이 나오는 것도 맞고 말이다.
다만, 유일한 걱정이라면 특정 모델 구조를 가지고 데이터만 바꿔서 학습시키는 건 학부생 레벨에서도 쉬운 일이라는 것 (물론, 장비와 시간만 있다면).
독자적인 AI 모델을 만들 순 있지만, 모델 구조의 변화를 가져오지 않는 구조 베끼기 수준의 데이터 끼워갈기는 모델의 효율성을 높이는 데에는 딱히 도움이 되지 않는다는 것이다.
실제로 쓰는데에는 문제가 없겠지만, 기술력 증진과는 거리가 먼 이야기라는 것...
여러모로 목적과는 좀 갈래가 많이 갈라지지 않았나... 하는 생각이 든다.
결론
1. 네이버가 잘못한 건 맞지만 그건 주최측의 잘못도 있다. 독자 개발'이라는 조건을 조금 더 명확하게 내걸었어야 할 듯.
2. 가중치 베끼는 건 자주 있는 일이다. 그게 효율성으로만 따지면 최고라서... 막 지탄받을 일이냐 하면 아니라는 거다.
3. 중국걸 베꼈다고 해서 그에 관한 문제가 터지는 건 아닐 듯. 뭐 배포한 측의 저작 조건에 어긋나는 무언가를 네이버가 하지 않았다면...
4. 개인적으로는 모델 구조를 베낀 게 더 문제라고 생각하긴 한다. 같은 모델 구조를 같은 데이터에 학습시키면 보통 같은 결론이 나오거든.
5. 모델을 효율화하려면 모델 구조에 변화를 주어야 하는데, 그게 아니라 좀 아쉽다.
(필자는 미국 아이비리그 중 한 곳에서 AI를 전공하는 대학원생이다. 당연하겠지만 공부 중이니 AI에 대해 전부 아는 건 아니다. 하지만 최대한 알고 있는 내용만으로 작성했으니 부족한 부분이 있다면 그냥 이해해라. 공부하느냐 바쁘다.)
'공지 및 잡담 > 잡담' 카테고리의 다른 글
| 요즘 술 리뷰가 사라진 이유 (0) | 2025.10.09 |
|---|---|
| 자주 쓰이는 위스키 용어? 정리 (0) | 2025.05.01 |
| 요즘 가볍게 먹고 있는 것 (0) | 2025.03.29 |
| 글렛리벳 2차 후기 +잡담 (1) | 2025.02.28 |
| 오랜만에 복귀입니다. (0) | 2024.05.04 |