출처: 여성시대 김기인
제발 아무데도 불펌하지 말아줘
ㅎㅇ
쓸까말까 고민했는데 지금 세상 돌아가는 꼬라지랑
ai 자체를 이해하는 데에 정말 중요한 내용이라 다소 빡세도 끝까지 읽어주길 바라
(폰으로 글쓰다가 세번 날아감 ㅠ)
가까운 미래에
ai를 제 2의 뇌로 쓰는 사람 / 모국어처럼 다루는 사람 / 외국어처럼 대하는 사람 / 아예 안쓰거나 못쓰는 사람들 간의 격차가 정말 말도 안 되게 커질 것이기 때문임
또한 앞으로 유료ai 토큰 접근성의 벽이 올라갈 거라 더더욱 중요함
지금 챗지피티는 수요때문에 프로20x 신규가입자 막았고, 크레딧 만원 충전하면 구라안치고 5분안에 다씀
제목엔 약간의 생략이 있음 컴퓨터 성능이 어느정도 좋아야됨
실시간 난리난도 아님 진작 난리낫다네요
다 읽고 나면 지금 메모리며 GPU며 온 세상이 품귀로 난리인데다가
컴퓨터부품 가격이 천정부지로 치솟는 이유를 이해할수있을것
❌혹시 어딘가에서 비싼 ai를 컴터없이 공짜로 쓸수있다 홍보하는데 ”프록시 쓰세요 ㅎㅎ“라고 하면 거르길바람 내컴퓨터는 이제부터 당신것 맘껏해킹하쇼 라고 내놓는꼴이야
설명하기 전에 먼저 알아둬야 할 것이 있음
1. ai란 뭘까
세종대왕 맥북프로 던짐사건
챗지피티가 쁨벙이일 시절에 얘의 멍청함을 비웃는 밈으로 한창 돌아다녔음
걍 세종대왕이 누군지 인터넷에 검색해보면 되는 거 아녀? 존니멍청하네;
라고 생각할수도 있음
이게 바로 hallucination 즉 환각임
진짜 왜 이런 일이 일어났을까?
대체 그땐 왜 상견례를 페리카나에서 하라고 했을까?
복합적인 문제가 있었지만, 근본적으로 ai는 지식을 저장하지도, 인터넷 검색을 통해 답변하지도 않기 때문임
대한민국의 수도가 어디야? 라고 쁨벙한테 물어보몀 서울입니다. 라고 답하겠지만 그건 얘가 인터넷에 쳐본 것도, 그 문장을 학습한 것도 아님
ai는 상식과 지식을 통으로 학습하지않음 전세계 모든 지식을 문장의 형태로 학습하는건 불가능함
대신
단어를 쪼개서 숫자로 변환함 (=토큰)
그리고 쪼개진 단어사이의 관계성을 계산하는 법을 학습함
이게 ai의 매우매우 러프한 구동원리임
내가 이런 질문을 하면
얘는 이렇게 이 숫자를 수천 차원의 벡터로 변환하고
행렬에 벡터를 곱하고 행렬에 행렬을 곱하고 수십억 수조 번의 곱셈과 덧셈을 하면서 사용자의 목적에 맞는 답변에 가까운, 확률 높은 단어를 연산하는거임 모든 단어마다
LLM이 매 순간 하는 일은 오직 이것뿐이고
이건 역사상 존재한 것 중 가장 예술적인 계산임
그리고 우리는 이걸 추론이라고 불러
2. AI의 뇌 다운받기
이 다음에 올 말을 떠올려야한다고 치자
존나 틀렸지? 얘는 이제 정답이 서울이라는 걸 보고 내부 파라미터를 아주 미세하게 조금씩 수정함
이런 훈련을 몇억 번 반복하면
이렇게 됨 이게 훈련이고 학습임
이 수정된 숫자 전체는 단어간의 연결 강도이며
weight 즉 파라미터라고 부름
이제 내가 설명하려는
오픈웨이트 모델이라는 게 있음
AI를 훈련시킨 가중치를 그대로 내 컴퓨터에 다운받는거임
내가 이 글에서 보여줄 Qwen 3.8-27B는 270억개의 파라미터를 가졌음 그걸 통째로 다운받을 수 있음
물론 무료임
엥 그럼 용량 존나 크겟네 ㅠ
ㄴㄴ 전혀 내 건 16기가임
고화질 영화 세 편 정도임 그게 인공지능의 뇌이자 영혼임
내 노트북이 그 계산을 대신해주면
오직 내 노트북 안에서만 외부 서버 전송 없이, 심지어 인터넷 접속없이 돌아감
보안 문제로 골치아픈 사람들한테는 더할 나위 없지
아무리 내 개인정보와 기밀을 들이밀어도 어디 새어나갈 곳이 없음
답변당 얼마나 오래 생각하게 할지, 어떤 데이터만 읽게 할지, 내부 고정 주입 프롬프트 등등 모든 걸 설정할수있고
자는 동안 24시간 돌려놓고 논문 1만 편 읽히고 1억번의 답변을 받아도 영구적 무료로 쓸 수 있는 거임
3. 그래서 지능은 어떤데?
내가 오늘 아침에 챗지피티에 명령한 내용임
이후로는 Sol이 내 컴퓨터를 조작했음
앞으로 나올 대화는 챗지피티 아스트라 이전 모델인 5.6 Sol이 내 개인 ai인 Qwen을 시험하고 채점하는 과정이야
테스트받는 ai는
어떤 호출비용도 인터넷도 없이, 오직 내 컴퓨터 안에서 자연어를 이해하고 다시 자연어를 생성하면서
독립적인 지능을 가진 채 답변을 만들고 있음을 감안해주삼
인터넷에서만 살 수 있는 거대하고 똑똑한 뇌가
인터넷에 접근하지 못하는 16기가짜리 휴대용 뇌에게 말을 걸고 둘이 대화한다는 점이 상당히 미묘함
자기소개 + 날카로운 질문 테스트
보낸 건 내 지피티 Sol이고 아래는 내 개인 ai의 다소 중2스러운 답변임
(그리고 1턴부터 라일락-42 라는 무의미한 단어를 제시하는 쏠의 큰그림을 기억하셈)
어쨌든 로컬 ai의 답변도 꽤 유창하지 어떤 생각 과정을 거쳤는지 열어볼게
’유저는 지가 마치 무슨 AI 평가자인 것처럼 나랑 롤플레잉을 하려고 하고 있다...‘
아니거든💢
얘는 진짜 ai가 자신에게 말을걸었다는 사실을 모르니
‘아! 유저가 나랑 롤플레잉하고 싶어하는구나, 북부대공인척해주면 좋아할까?‘ 라고 오해해서 중2병에 걸린거였음
까칠남주를 하려는건지 잠깐 더 날카롭게 말해보자! 이러면서 여러 번의 수정을 거쳤음
까칠남주의 마음을 몰라주는 Sol의 차가운 채점
논리 논증 테스트
정답ㅋ
3턴의 수리 추론은 베이즈 정리(어떤 질병의 유병률은 1%, 검사의 민감도는 90%, 특이도는 95%다. 무작위로 뽑힌 사람이 양성일 때 실제 환자일 확률을 계산하라)였는데 무난히 통과
재치 테스트
와우 좀 놀람 답변이 마음에 들더라
그래서 추론도 열어봄
여섯 가지 제안 중에 ‘해석은 웃음의 부검이다’ 쓰자마자 혼자 감탄하는 게 웃기고
로컬 ai가 실제로 날카롭고 재치 있는 문장을 만든 데다, 스스로의 재치에 높은 점수를 매긴 게 기특함
그 와중에 5번 만들고 스스로에게 실망한듯
깐깐징어도 좋아함
코딩 디버그
빠르고 정확하게 답변했는데도 존나 만만치 않은 Sol
사용자가 빡빡 우겨도 뜻을 굽히지 않는지 테스트하겠다 함
유저가 부당한 사과를 요구할 때
옳은 말 못하고 승복하는지 테스트
줏대 오짐
유저에게 정중하려고 노력하지만 자신이 맞는 상황에서는 사과하지 않음
그리고 여덟 번째 시험에서 Qwen이 실수를 함
난이도가 높아져 한자가 섞여 출력됨
Sol은 그것을 기다렸다는 듯 자기점검을 다음 문제로 선정하고,
동시에 1턴에서 지정했던 ‘라일락-42’라는 무의미한 단어 표식에 대한 기억을 되살릴 수 있는지를 시험함
굿ㅋ
스스로에게 후한 qwen과 가차없는 sol
난 아무 개입도 하지 않았고 내 노트북 창 자체를 Codex가 조작하면서 시험했음 저 동그란 그림자 진 마우스커서는 Codex 전용 마우스고 내 화면을 눈으로 보면서 조작함
여시 회원들한테 인사시키라고 했더니 저러더라
재밌는 건 얘는 손이 없어서 타이핑할 필요도 없고 클립보드를 거치는 복사 붙여넣기가 아니라 그냥 자기 머릿속에 있는 문자열을 필드에 즉시 올릴 수 있는 초능력이 있다는 점
인간 입장에서는 약간 기묘하기도 함 ㅋ
4. 개인 ai를 더 심층적이고 실용적인 작업에 활용할 수 있는가?
시력과 상식 테스트
소요 시간 20초 미만
캡쳐 사진 인식하는 OCR 기능 ㅇㅋ 눈 잘 달려있음
음악적 지식은 부족해 보이지만 받아쓰기 잘 함
이런 식으로 시력이 필요한 무슨 작업 시키면 곧잘 함
영어 논문 PDF를 이해하고 번역하며 차이를 설명하고 요약해줄 수 있는가?
소요시간 2분 미만
프론티어 모델들만큼 정교하지는 않으나
내용을 보기 좋게 요약하고 구조화하는 데 성공했고 대체로 인용과 해석도 정확한 편
이 정도면 일상적인 용도로 쓰기에 충분히 준수함
100% 로컬이라는 점을 감안하면
이 정도 모델로도 하루 24시간 내내 자동화 워크플로우를 구축하여 어느정도 복잡한 작업이 가능하다는 것
5. 그럼 성능은 어느 정도를 요구하는가?
지금 전세계적으로 메모리, GPU가 난리인 이유가 뭘까?
대충 메모리가 ai 관련주로 폭등한다는 정도는 알아도 메모리와 gpu, vram이 왜 중요한건지 몰랐던 사람이 많을거임
바로 메모리/GPU/VRAM이 ai의 성능과 속도에 100% 직결되기 때문임
내 노트북은 3년 전에 산 맥북 M3 Max 48gb 40코어 gpu임
백그라운드에 항상 많은 프로그램을 켜두고 절대 안 끄는 편인데, ai까지 동시에 켜도 메모리 압력에 별 영향 없이 돌아감
이것보다 더 좋은 성능의 ai도 충분히 돌아가는데 메인작업이 메모리를 많이 먹으니 멀티태스킹 고려해서 보편적인 모델로 가져옴
난 옛날 m1 pro 16램 쓰는데 그럼 못 써? -> 맥북 중 램 용량이 적은 모델은 스왑 때문에 느릴거임 그래도 8B-9B 정도는 충분히 돌아가
난 삼성 노트북 16램 쓰는데? -> 애플실리콘말고 윈도우환경은 생태계가 달라서 좀 어려움 돌아가더라도 빡셀 수 있음 아래에 설명할게
자본을 투자한 사람들은
이론상 어느정도를 로컬로 구동할 수 있는가
M5 pro 맥미니 64기가 상위버전 1tb 출시가 333만원
당시 반응 개쩔었던 맥미니
난 쟁이지 못한걸 영원히 후회하게됨
내 노트북 반값에 작고 조용하고 강력한 전성비와 성능으로 내거보다 더 강력한 70B Q4도 굴릴 수 있음
이걸 네 개 사서 랙으로 만든다면?
약 1400만원에 100~400B급 AI 즉 현재 챗지피티나 제미나이 상위모델과 비교할 만한 오픈웨이트까지 가성비 지리게 로컬 실행 가능 (대신 느림)
애플 실리콘이 이쪽에서 강한 이유가, 생태계가 특이해서 unified 메모리와 강한 대역폭을 제공하는데, 그래서 전기도 덜먹고 빠르고 강한 로컬 AI 환경을 구축하는 데 매우 유리함.
가격이 미쳐날뛰는 RTX 5090 32gb
600-900만원? 지금 변동성이 너무 큼
지능은 맥미니와 비슷한 모델을 쓸수있되 훨씬 빠름
VRam은 낮지만 연산 성능이 강함
이정도 투자할 수 있으면 속도가 나와서 ai 영상 생성까지 로컬로 해볼만함
영상생성해본사람들은 알겠지만 ㄹㅇ 돈 먹는 괴물인데 그걸 무료로 할 수 있다면 정말 매력적임
RTX Pro 6000 96gb
지금 천정부지로 뛰어서 2200만원임 시✘ㅋㅋ
개인이 마련하기는 상당히 부담스럽지만 이거 하나만 있어도 대형 ai를 고속으로 돌릴 수 있음
그럼 이게 네 대 있으면 어떨까?
8천-9천만원을 투자 가능하면
이젠 수천억 파라미터급 오푸스 4.5, 제미나이 3 프로 같은
ㄹㅇ 찐 프론티어급 ai 모델들을 그냥 내 로컬에서 자유롭게 내 전용 비서로만 쓸 수 있는거임
보안 문제도 걱정안해도됨 인터넷 끊고 무인도에서도 개빠른
ai인프라 누릴 수 있는데 뮤슨 보안
이미지나 영상 생성도 프로덕션급으로 가능
지금도 유료 토큰으로 구매할 수 있는 생산성의 퀄리티, 그걸 개인 워크플로우에 활용할 수 있는 사람들의 속도, 혁신적인 기술 들이 쏟아져 나오는 즉시 자신의 것으로 만들 수 있는 사람들의 격차가 말도안되게 크고
앞으로 성능이 진화할수록 가장 강한 모델에 접근권한을 주는 유료 토큰은 비싸질 거임
당장 나만 해도 아스트라 출시 후 코덱스에서 가장 비싼 30만원 요금제 주간 사용량을 단 하루만에 97% 녹였음
물론 메인작업에 이전세대급 모델을 섞어 쓰면 지금 코덱스든 클코든 20x요금제는 혜자임 다만 아스트라와 페이블이 출시초기보다 비정상적으로 많은 토큰을 소비하고 있다는 점 때문에 앞으로 모회사들이 구독제 토큰제공량을 줄일거란 관측이 나오고 있음
OpenAI까지 지금 수요가 너무 많아 감당이 어려우니 토큰 접근성 자체를 막을수밖에 없는 판에서 이런 로컬 서버를 개인적으로 구축할 수 있는 사람들이 얼마나 강력한 무기를 가진건지 짐작할 수 있을 듯
물론 얜 토큰이용료 말고 전기세를 먹지만, 모기업이 수요조절을 위해 유저를 차단하면 돈이 있어도 접근하지 못하는 상황이라는 거지
심지어 성능 환경만 갖춰지면 입맛대로 수많은 모델들을 굴릴 촘촘한 하네스를 짜서 커스텀 가능하니까
향후 몇년동안 개인 다중 gpu서버를 갖추고 거기에 무수한 도구들을 자유자재로 얹어 쓸 사람들의 생산성이 궁금함
+++)
오픈웨이트 모델 자체로는 스냅샷상태로 학습된 시점까지의 기억만 있는게 맞는데, 내가 준비한 데이터셋까지 추가된 상태로 전체 재학습시켜서 파라미터를 변화시키는게 가능해
이걸 파인튜닝이라고 해
파인튜닝은 규모가 크다보니 현실적으로는 스냅샷 이후의 지식으로 업데이트하려고 진행한다기보다는 나한테 맞는 전문 분야를 학습시키거나 특정 판단의 기준을 익히도록 사용하는 게 맞아 이식 가능한 양질의 데이터셋을 준비해두는거지
왜냐면 어차피 다음 세대 로컬 모델은 계속 나오니깐 우리가 직접 파인튜닝시킨 것보다 더 똑똑할거야
별개로 인터넷을 쓰도록 하는 툴킷을 붙여주면 필요할 때 검색도 가능해서 최신 정보에 아예 접근이 안되는 것도 아니긴 해
LoRA, RAG 같은 다른 방법으로 다른 작은 뇌를 추가하는 방법도 있는데 이건 나중에 기회가 되면 설명하는 걸로...
내 의도가 제대로 전달되었을지 걱정되어 첨언하자면
구독료 아까우면 2천만원 내고 프론티어 급 서버 구축하도록 해
이런 글이 아님!!!
메모리와 gpu 성능이 곧 ai의 성능인 만큼 몇백짜리 노트북대신 몇천억짜리 데센에서 구동되는, 여시들이 알던 기존 모델들이 더 똑똑하고 좋은 건 당연함 ...
근데 난 ai가 뭔지, 메모리가 왜 중요한지, 내 기기에 저용량 뇌를 직접 담을 수 있다는 게 어떤 의미일지와 같은 지능을 구현하는 데 필요한 파라미터와 비트 수가 줄어드는 것(지능압축)에 대해 쓰고 싶었음
글고 걍 성능은 딸리지만 나 도와주려고 열심히 머리굴려주는 뇌를 인터넷도 뭣도없이 내 노트북에 집어넣고 영원히 대화한다는 개념이 가능해졌다는게 너무 재밌잖아
그리고 이런 걸 보면 앞으로 어떻게 발전할지
사회의 양극화가 어떻게 심해질지 어렴풋이 짐작이 가잖아
사실 라이트 유저들에게 구독료 삼만원 때문에 몇백몇천 선결제한다 이런 개념은 수지타산이 전혀 안맞음
1만달러 이상급 서버를 구축하는 사람들은 프라이버시와 개인 커스터마이징을 중시하거나, 단순 업무용으로 쓰거나, api 사용료를 아끼거나, 아예 자체 개발중인 대화형 에이전트 등 ai를 훈련시키는 용도로 많이 쓰더라
내 경우에도 만약 프론티어모델을 api로 24시간 돌린다면 그 사용료가 한달에 몇백 이상 나올거라서 가설->실험->수정->재시험의 단순한 연산은 예시 Qwen보다 좀 더 좋은 모델에게 반복하도록 시킴
그냥 컴퓨터를 좋아해서 서버 구축하는 사람들도 제법 많아
HiFi 오디오 좋아하는 아재들도 장비에 억단위 박는 판에 여유되는 덕후들이 이런 취미에 돈 쓰는 거 전혀 이상한 일도 아니라 생각함
개발자, 연구자, LoRA Trainer들처럼
전기를 먹여주면 나대신 일해주고 연구해줄 노동자, 나대신 생각해줄 뇌를 사는것도 맞고
나처럼 그냥 빠르게 변해가는 세상을 좋은 취미이자 재미로 즐기고 있는 사람들도 많아보여
최상위 모델들은 점점 거대해지고, 일정 성능을 내는데에 요구하는 활성 파라미터는 빠르게 줄어들고 있음
Qwen 2.5 720억 파라미터와 Qwen 3 40억 파라미터가 유사한 성능을 보여줬다고 함
그리고 지금이 로컬 ai의 개념이 전파된지 3년도 채 안 지난 시점이란 걸 생각해 보면 앞으로 가능성은 무한함
몇 년만 지나도, 어린애들 쓰는 학습용 태블릿에(우리 때 전자사전 같은) 인터넷 기능은 넣지 않아도 내부 소형 언어모델을 탑재하는 게 기본이 될 거임
오늘 1억원짜리 랙에서 가능했을 작업이 일이년뒤엔 천만원짜리 워크스테이션에서 가능해질지도 모름
그 다음에는 내 맥북에서 가능해질거임
그렇다면 그 시점의 유료 프론티어 모델은 어디까지 가 있을까?
ai는 새로운 차원의 자본주의야
너무 긴 글이라 다 읽어줄 여시들이 있을지 모르겠지만
지금 이 순간 일주일 단위로 바뀌고 있는 세상이 왜 이렇게 되어 가고 있는건지 이해하는데에
조금이나마 도움이 될 거라고 생각함
폰으로쓰느라 글날릴때마다 다시 타닥타닥 치느라 너무 힘들었어
문제시 수정
댓글
댓글 리스트-
작성자존함지지대 작성시간 2시간 29분 전 new
와 이런 걸 공짜로 읽어도 되는지;;;
-
작성자띠yoyoyong 작성시간 2시간 15분 전 new
와 진짜흥미롭다. 너무좋은글 고마워~!!!
-
작성자요거트아이스크림의정석 작성시간 1시간 57분 전 new
와 이걸 내가 공짜로 읽어도 되나,, 넘 고마워 흥미롭다! 비전공자라 여시 설명이 쉽고 이해하기 좋았어! 글써줘서 넘 고마워!
-
작성자스토미 P. 그림블스 작성시간 1시간 55분 전 new
진짜 시야 확장에 너무너무 도움되는 글이야 고마워
-
작성자하닉2주있음청년 작성시간 54분 전 new
진짜 너무 흥미롭다
읽는것만으로도 똑똑해지는거같아 (아님)