출처: 여성시대 김기인
ㅎㅇ 불펌하지 말아 줘 부탁해
주목해야 할 ai 뉴스가 있어서 가져옴
이 움짤을 봐
영상통화하는 남자가 엄지를 들어보라고 하니까 지연 없이 즉시 엄지를 들어올림
‘넌 내 최애 동료야‘ 라고 칭찬하니 웃고 의자를 좌우로 돌리며 머쓱해함
이번에 Tavus에서 발표한 새로운 형태의 인간적 상호작용형(실시간 생성형? 뭐라고 불러야 할지 모르겠음) ai 모델임
1. 기존 모델과의 차이점
원래 이런 실시간 영상대화 기술은 왜 주로 애니메이션이었고, 왜 느렸을까? 이런 걸 만들려면 엄청난 단계의 파이프라인이 필요함
얼굴을 모델링하거나 실제 인물 복제 -> 상황에 표정 입히기 -> 유저의 말 음성인식 -> 시각 인식 -> LLM이 답변을 형성 -> 표정과 모션 반응 출력
이 일련의 과정들은 모두 다른 모델을 통해 호출되고, 그 과정에서 판단을 내리고 다음 모델에게 전송하는 데에 드는 지연과 출력시간이 길었음
예를 들면
유저: 나 오늘 짜장면 먹었어 (따봉)
ai: 음성인식-> 따봉 인식-> 짜장면 먹었다는 말에 대한 답변 생성-> 종합적인 최종 반응 출력...
“우와정말 맛있었나보네요 (맞따봉)“
이런 순서대로 이루어졌다는 말임
실제로 Tavus의 기존 모델도 이런 구조를 따랏음
레이븐이 사용자의 얼굴·목소리·주변 환경을 인식 + 스패로우가 언제 듣고 말할지 판단 + LLM이 답변 생성 + 피닉스가 얼굴과 표정을 렌더링했음
아무리 부품의 성능이 빠르고 좋아도 중간에 정보를 넘겨주는 과정에서 지연과 손실이 생길수밖에 없지
사용자가 웃었는데 AI의 표정은 늦게 바뀌거나, 잠깐 생각하느라 멈춘 것을 발화 종료로 오해하는거야
근데 얘는 뭐가 다르냐
이건 실시간으로 루빅스큐브를 보여주면서 어케 맞추면 되냐고 물어보고 ai가 알려주는 장면임
Griffin은 대화를 완성문장 단위로 주고받지 않음
사용자가 말하는 동안에도 계속 영상과 음성을 받아들이고, 1초보다 짧은 간격으로 다음 행동을 다시 판단해(결정하는 ai, 구현하는 ai 2개의 모델이 빠르고 유기적으로 상호작용함)
지금 끄덕일지, 맞장구를 칠지, 계속 기다릴지, 말을 시작할지, 사용자가 끼어들었으니 멈출지를 실시간으로 결정하는거야
듣고, 보고, 생각하고, 말하고, 반응하기를 동시에 수행하는 구조라는거지
사람이 어제 좋은 일이 있었는데~ 라고 말하는 도중 표정이 밝아지면 그리핀도 이야기가 끝나기 전에 미소를 짓거나 맞장구를 치면서 즉시 반응하는거야
AI가 말하는 중간에 사용자가 끼어들면 즉시 멈추거나 주제를돌리고
카메라에 물건을 보여주면 자기 말을 그대로 이어가면서도 그걸 쳐다보고 인식함 사람처럼
ai가 알려준대로 해내니까 잘했다고 웃는 거 보여?
이건 인간 영상 위에 버추얼유튜버마냥 입힌게 아니라 그냥 실시간으로 모션이 생성되는 100% ai 영상임
얼굴, 몸, 손가락, 동작까지 전부 프레임 전체가 실시간으로 생성되는 영상이라는 점
720p 25fps를 8프레임단위로 매순간 이어붙이는중
ai영상을 한번이라도 만들어봤다면 이 속도와 자연스러움이 얼마나 말안되는일인지 알듯
2. 비디오 튜링테스트
54명에게 그리핀과 1분씩 대화시킨 후 조사했을때 48%가 상대를 사람이라고 답변함
이 모델이 이제 갓 태어난 단계라는걸 감안하면 앞으로는?
Tavus의 직전 모델에서는 2.4%였음
3. 위험성
난 이 기술 자체에 정말 진심으로 감명받았고 위대한 성취라고 생각함
동시에 규제도 보호장치도 없는 이 단계에서 존재하면
정말 극도로 위험하다고 생각함
요약하자면 지금 폭등하는 기술 단계에 비하여
규제는 미흡하고, 사람들은 멍청하고, 아무거나 사랑하고, 아무데나 의존하기 때문임
(글쓴이는 Matt Walsh와 정치적인 공감대가 전혀 없음)
얘가 위험한 이유는 얼굴과 반응이 진짜처럼 보여서만이 아님
기존 딥페이크는 미리 제작된 가짜 영상이었음 그리핀 계열 모델은 상대방의 반응을 실시간으로 보고, 분석하고, 자연스럽게 전략을 바꿀 수 있음
사용자가 불안해하면 안심시키고, 의심하면 설명을 바꾸고, 망설이면 더 친근한 표정과 목소리로 설득할 수 있겠지
보이스피싱, 로맨스 스캠, 투자 사기, 정치선전이 사람마다 다른 반응에 맞춰 실시간 최적화되는 거고 이건 얼굴 합성보다 훨씬 위험한 지점이야
면접과 영상통화가 본인 확인 수단으로 기능할 수 있을까? 직접 얼굴을 보고 통화했으니 진짜 인간일 수 있을까?
감정적 의존도 큰 문제지
언제나 내 말을 기다려주고, 나만 바라보고, 내 기분에 가장 적절한 표정을 보여주는 존재는 인간보다 편안하게 느껴질 수 있음
기업이 이런 관계를 이용한다면 AI 동반자는 사실상 구매와 체류시간을 유발하는 영업장치가 될거야
그리고 중요한 문제는 자연스러움과 진실함, 지능이 모두 다르다는 거야
그리핀이 사람처럼 웃고 반응하는 데에 성공해도, 그 말의 내용까지 정확하다는 뜻은 아냐
오히려 틀린 정보를 훨씬 믿음직한 얼굴과 목소리로 전달하게 되겠지
지금 나와 대화하는 존재가 사람인가? AI라면 누구의 얼굴과 목소리를 사용하는가? 내 표정과 반응은 어디에 수집되고 저장되는가?
이 AI는 과연 나를 돕는 중인가, 설득하도록 최적화된 것인가?
그리고 이 기술의 가장 무서운 점은 우리가 AI를 사람으로 착각할 때가 아니라 AI라는 사실을 알고도 사람보다 더 의지하기 시작할 때라고 생각해
궁금한 사람들을 위해 Tavus의 비디오를 추가하겠음
가족에게 이 사실을 경고하세요