출처: 여성시대 김기인
ㅎㅇ 제발 아무데도 불펌하지마셈
아래 내용은 9/9 16시 기준이며 실시간 논쟁이 진행중인 사안인 만큼 새로운 사실관계가 확인됨에 따라 일부 내용이나 해석이 달라질 수 있음
2편
https://m.cafe.daum.net/subdued20club/ReHf/5737727?svc=cafeapp
챗지피티의 모체 OpenAI는 오늘
자신들이 나비에-스토크스 방정식을 풀었다고 발표함
이건 상금 100만 달러가 걸려 있는 수학 난제이며 밀레니엄 난제라고도 불림
물이나 공기가 어떻게 움직이는지 계산하는 공식임 근데 이게 왜 난제냐?
아주 쉽게 설명하면, 당신이 컵 속 물을 스푼으로 아주 부드럽게 회전시킨다고 가정했을 때, 어느 시점에서 그 소용돌이가 무한대 속도로 회전할 수 있는가?
정상적인 초기값이 유체 변화율을 무한히 만드는 특이점(singularity)이 있을 수 있는가?
이건 지난 몇십 년 동안 아무도 풀지 못한 난제임
이것 때문에 인류는 아직 비행기가 뜨는 원리를 파악하지 못했단 우스갯소리가 나옴
그런데
9월 9일 오전 2시 그러니까 오늘 새벽에 올라온 트윗임
공식적으로 우리가 이걸 풀었다고 발표해 버림
심지어 Astra 보다 더 발전한 미공개 신모델 1만 개를 투입해서 88시간만에
와 대단하다 이제 ai가 예술계에 이어 수학적 난제도 정복하고 모든 걸 다 정복하나?
--> ㅇㅇ ai는 이미 수많은 분야에서 인간을 월등히 앞섰고 앞으로도 그럴 거임
여기서 끝나지 않음 이것만으로도 놀랍지만 진짜 쟁점은 이거임
두 명의 수학자가 있음.
Tristan Buckmaster와 Levent Alpoge
트리스탄은 NYU 소속, 레벤트는 앤스로픽(오픈ai 경쟁사 클로드소속)
이 두 사람은 1년 내내 이 문제에 매달려 옴
천문학적인 연산량을 극복하고 최신 ai 컴퓨팅 자원을 활용하기 위해 이들은 연구 프로젝트를 코덱스(open ai 에이전트)에 올려서 돌렸고, 프로젝트의 모든 비공개 초안을 챗지피티에 올려서 몇달간 계산을 명령했다고 밝힘
따라서
비의도적으로나마 OpenAI의 신모델이 두 수학자의 코덱스 세션 내용을 학습했고
사측에서는 이들이 연구하던 프로젝트의 연구 방향성과 동일한 방식으로
내부 미공개 최신 모델 1만 개의 컴퓨팅 자원을 활용해서
나비에 스토크스 방정식을 풀었다고 발표해버렸을 의혹이 제기됨
그리고, 사람들은 어쩌면 이들의 연구 내용을 사내에서 직접 확인하고 (사측에서 ‘나비에 스톡스 방정식 진척에 대한 소문을 들어 연구에 착수했다’고 언급) 프로젝트팀을 신설했을지도 모른다 추측함. 이건 미확인 음모론임
“세상에는 나비에 스토크스 접근법이 수없이 많은데, 우리가 1년 가까이 비공개로 연구해왔고, 몇 달간 너네 모델로 연구해서 돌리던 Smooth-Forcing Route를
갑자기 너네가 미공개 신모델을 활용해 같은 경로로 88시간만에 풀어냈다고 주장하는 게 우연일 수 있는가?”
라는 게 수학자들의 주장임
또다른 의문점으로, OAI가 두 수학자에게 접근했을 때
둘 중 레벤트는 앤스로픽에서 일하는 사람이라 레벤트를 크레딧에서 제거하고
트리스탄을 공동크레딧에 올리는 것을 제안했다고 함
실시간으로 레벤트는 트윗 올리는 중
논란이 심화되며 Open Ai는 미묘한 입장을 밝힘
“우리는 이 문제를 풀기 위해 특정 사용자 데이터에 접근하지 않았다”
하지만 동시에 “그들이 우리 제품을 사용하면서 생성된 de-identified data(익명화 데이터)가 모델 개선에 기여했을 가능성을 배제할 수 없다”
고 말함
그리고 수학자들은
과연 오픈ai의 접근 방식이 실제로 나비에 스토크스 방정식을 풀었다고 할 수 있는가? 이건 그냥 거대 개념적 사기극이다 라고도 말하고 있지만 글이 너무 길어질 것 같으니 생략히기로 했음
+
또한 Jacob Coxon이라는 앤스로픽 근무자가
퇴사하며 오늘 올린 폭로성 트윗까지 겹쳐 더더욱 불타는 중임
17시 이후로 본문 수정하지 않았는데, 댓글에 내가 의도적으로 ‘오픈ai가 수학자들 데이터를 훔쳤다’는 식으로 편중되게 작성했다는 논란이 있어서 설명글을 추가할게
내 글은 OAI 직원들이 이 수학자들의 코덱스 세션 내용을 몰래 훔쳐보고 그걸 쌔벼서 자기들 성과처럼 발표했다는 내용이 아니야
Buckmaster랑 Alpoge 입장에서도 OpenAI가 자신들의 연구 내용 세션 전체를 들여다보고, 그걸 직접 훔쳤다는 주장은 하고 있지 않음
본문 내용도
다른 연구자들이 대부분 같은 방식으로 접근하지 않고 있던 smooth external forcing 조건을 이용해서 OpenAI의 미공개 신모델이 나비에스톡스 방정식을 풀었다고 발표할 때,
Codex 신모델의 de-identified usage data를 통한 학습의 간접 영향을 배제할 수 있는가?임
그럼 앞으로 AI는 아무런 연구도 하면 안 되는 거? -> 그럴 리가 없음. 회사 측이 소문을 계기로 직접 나서서 대형 프로젝트를 꾸렸고, 대중적인 접근법으로 연구한 게 아니기에 문제가 되는 거임
두 연구자가 거의 누구도 가지 않던 길을 ai와 함께 1년간 걸으면서 지도를 그리고 이정표를 세웠음
그리고 그들이 가는 쪽 길에서 진척이 있었다는 소문이 ai 회사에 전해짐
직후 ai 회사가 거대 불도저를 가져와서 “우리가 소문을 듣고 개쩌는 불도저 1만개로 며칠만에 앞뒤옆길을 싹 밀어봤는데 알고보니 옆길이 맞는 길이더라. 끝에 사람들이 100년동안 찾던 보물상자가 있었음. 근데 맹세코 난 지도 내용은 본 적 없음, 하지만 불도저가 이정표를 학습하지 않았다고도 확신할 수 없음” 이라고 발표했을 때
선행연구자들의 공여가 있었기에 불도저가 굴러갈 수 있지 않았을까? 라는 의혹임
그건 이제 누구도 속시원히 대답해 줄 수 없지.
우리가 가져야 할 연구윤리적 의문은 이거야:
1) 개인적으로 연구하던 수학자 팀의 미공개 성과에 대한 소문을 신호로 삼아 AI 회사 측에서 일반적 경로로는 접근불가한 초대형 컴퓨팅 자원을 투입했다
2) 과연 이 다음에도, 또 그 다음에도 AI 회사 측에서 컴퓨팅 자원을 천문학적으로 필요로 하는 과학적 발견을 이룩하려고 시도할 때, AI 연구 도구를 활용한 인간의 미공개 연구가 그 재료가 되지 않을 수 있을까?
나도 Codex 20x pro 사용하면서 몇달동안 24시간 내내 개인 연구 세션 돌리고 있는 입장에서 회사 측이 코덱스 세션을 직접 열람하리라고는 전혀 의심하지 않아
OpenAI가 직접 밝힌 공식 입장은 “이 문제를 풀기 위해 특정 사용자 데이터에 접근하지 않았으나 두 연구자의 자사제품 사용에서 파생된 de-identified data가 모델 개선에 기여했을 가능성은 배제할 수 없다” 즉 ‘연구자의 세션을 직접 열람함’과 ‘미공개 연구 데이터가 비의도적으로 모델 개선에 기여했을 가능성’ 중 후자에 주목해주길 바람
이번 OAI의 성과가 진공 상태에서 독립적으로 시작한 capability demo가 아니라는 점은 또한 데이터 거버넌스와 상업 연구윤리적 의문을 제기해
연구자의 미공개 작업을 도와주는 플랫폼 사업자가 그 연구 활동으로부터 직간접적으로 정보를 얻거나 모델을 개선할 수 있는 구조에 있으면서,
동시에 막대한 독점적 컴퓨팅을 이용해 동일한 scientific priority 레이스에 참가하고 그 결과를 자사모델의 우월성을 입증하는 상업적 자산으로 사용할 수 있을까?
학계에서는 타인의 미발표연구를 입수하는 경로에 따라 연구윤리 의무가 생기고(논문심사자가 자기가 심사한 논문 내용을 활용해 더 발전된 논문을 본인연구처럼 출간하면 비난의 대상인 것처럼)
이런 방식으로 마일스톤적 성과를 이룩했다는 인접연구물을 발표해버리면 명백한 연구윤리 위반이지만, 지금처럼 AI가 피어-리뷰어도, 공동연구자도 아닌 상황에서 적극적으로 활용할수밖에 없는 상황인 경우에는 너무 큰 회색지대가 생기는 것 같아
특히 이번 나비에스톡스처럼 학계에서 명성과 우선권이 극도로 중요한 사례라면 더더욱 그렇지
OAI는 “우린 특정 소문을 듣고 이 연구에 착수했는데 알고보니 그게 트리스탄과 레벤트에 관련된 것이었다”라고 공식적으로 언급했어
“Our effort began on September 1st after hearing a rumor which we later realized was related to Levent Alpöge, an Anthropic employee, and Tristan Buckmaster, a math professor at NYU.”
물론 벅마스터 팀과 별개로, OAI의 엔진은 독립적으로 아주 아주 강했을 가능성이 크지.
하지만 1만 에이전트 군단이 그 시점 그 문제에 투입된 데엔 분명 트리거가 존재했고, 그들이 어떤 영역을 탐색했는지, 그리고 엔진 자체가 어떤 데이터를 학습했는지를 선행연구와 완전히 분리 증명하는 것은 이제 불가능해 보여.
알려진 사실을 종합하면,
외부 연구팀의 비공개 돌파구에 관한 정보가
실제 AI 자원을 판매하는 회사에서
일반적으로 접근하지않던 연구방향으로 막대한 자본과 차세대모델 컴퓨팅 자원을 투입할 계기가 되었고,
그렇게 얻은 결과는 수학계의 중대한 발견임과 동시에 차세대모델의 수학능력을 입증하는 벤치마크적 홍보자산으로 사용됐어.
실제로 코덱스 세션을 뜯어봤을 리가 없어도,
해당 수학자들이 가졌던 “training에 우리 세션이 사용되었냐” 라는 의문에
'가능성은 낮지만, 이 문제를 연구하던 사용자의 익명화 데이터가 모델에 간접적 영향을 주었을 가능성은 배제 못한다'라는 답변을 받았는데,
개인의 연구 활동이 수개월~1년간 특정 ai 모델들을 통해 진행되었고, 해당 데이터를 통해 간접적으로 모델을 개선할 수 있는 위치에 있는 AI 회사가
압도적 성능의 신모델과 컴퓨팅 자원으로 유사 연구방향의 밀레니엄 수학 난제를 선점했냐는 게 지금까지의 쟁점이야.
AI의 발전은 학계에 축복일까 공포일까?
우리는 지수적으로 가속하는 이 세대를 어떤 태도로 받아들여야 할까?
tmi) 난 ai 음모론자가 아니고 오히려 ai 구독료만 매달 1천 달러씩 결제중인 헤비 유저임 8년전 쩌리에 초인공지능 관련 글도 처음 가져왔고, 챗지피티 물 낭비 루머 반박글도 올렸었음!
다만 AGI가 갓 태동하는 시점에 AI가 서 있는 윤리적 회색지대에 대한 논의는 정말 필수적이라고 생각함 여시들의 생각은 어떤지?
댓글
댓글 리스트-
작성자겨란찜과 작성시간 26.09.14 후속기사 원해요...
-
작성자오렌지는왜오렌지일까 작성시간 26.09.17 와
-
작성자standandsit 작성시간 26.09.18 글고마워
-
작성자리틀리를리틀 작성시간 26.09.18 오..
-
작성자마라냉국수 작성시간 26.09.19 new
근데 에이아이를 쓰는 동시에 무조건 기술이든 이론이든 누출되는건 백퍼인거 아냐? 일반인인 나도 알고... 에이아이가 정확히 어떤 경로로 결론을 내리는지는 아무도 모르고 그 경로 자체가 불법적인 정보나 개인적인 정보 등등도 포함할 수 있다는 것 그 연구원들이 몰랐을수가 없는데... 에이아이 쓴 것 부터가 본인들도 리스키하단걸 알았을거 아님?.... 물론 이 부분이 어떻게든 보호받아야하겠지만 현재 기술수준으론 증명이 안되는데 어떡함..
