똑똑한 모델이 더 쌉니다?
어느 수준 이상의 지능에 도달하면 간단한 작업을 더 간단히 힘 빼고 쉽게 할 줄도 알게 될 것이다. 리즈닝토큰을 적게 소비하는걸 넘어 MoE에서 한발 더 나아가 최근 언급되는 dynamic depth나 early exit 같이 효율성 자체가 목적함수로 포함되어 학습될 수도 있고, 그것도 아니고 그냥 지능이 상승하며 스스로 효율성을 체득하는 창발이 일어날 수도 있을테다.
이게 적절한 ops발달과 함께 간다면 지금 우리가 클로드코드에서 하는 서브에이전트 만들고 다듬는 노력들 또한, 몇 달 후에는 쓸모 없어지는 또다른 bitter lesson이 될 수 있다. 구글 antigravity가 이러한 방향을 염두에 두고 있는거 같기도 하고. haiku, sonnet, opus, pro 같은 모델명은 사라지고 그냥 claude모델, gpt모델, gemini모델 같이 브랜드명만 남게될지도. 오토라우팅으로 겉으로만 하나로 보이는게 아니라 실제로 하나의 모델만 존재하는.."
Related
GPT-4가 보여주는 것은 기술이 아니라 속도다
GPT-4 공개의 핵심 포인트를 짚는다. 한국어 능력의 도약, 토큰 확장의 의미, OpenAI의 비즈니스 전략, 그리고 Open이라는 이름의 아이러니까지.
카파시는 LLM을 자아를 가진 존재가 아니라 시뮬레이션 엔진으로 대해야 한다고 조언한다. 이 관점은 AI 활용법을 넘어 AI를 존재로 인식하는 문제의 해결 시작점이 될 수 있다.
3사 AI 리서치 비교해보기
3사 AI 리서치 기능을 업무용으로 비교한 결과, 클로드가 858개 출처에서 100여 개 데이터셋을 찾아내며 압도적이었다. 정보 수집 작업에서 에이전틱 동작의 차이가 크다.