"오늘의 두 가지 멋진 소식. 이를 접하자마자 떠오른 공상들을 메모차 적어봄
- LLaMA2 공개
-
사실 LLaMA1의 소식과 이를 기반으로 한 각종 파생모델에도 관심 안가졌던 이유가 실 서비스에 적용할 만한 성능이 나오지 않는다는걸 테스트 해보지 않아도 알 수 있을 정도여서. 이전보다 훨씬 좋아진 성능인건 맞지만 GPT3.5가 보여준 '체감할 수 있을 정도의 효용'의 threshold를 넘진 않은것으로 보여, 좋아진게 의미가 없다고 생각했음
-
만일 LLaMA2가 정말 알려진 수준(chat에서는 chatGPT(3.5)에 버금가는 수준?)의 성능이 맞다면, 이제 또 새로운 phase가 열릴듯 GPT4를 꼭 써야하는 영역이 아니라면, 그리고 서비스 용도가 아닌 내부 업무 용도로 쓴다고 하면 Claude2 등과 함께 고려해볼만한 선택지가 될 수 있지 않을까.
-
하지만 그 용도가 ""한국어""라면, 아직 기대하기는 이를거라 (근거없는) 추측중. 그 이유는 GPT가 나온 이후의 후발주자들의 목표는 당연하게도선행주자인 GPT를 따라잡는 것이 되어버렸기에, 영어, 그리고 공개된 테스트데이터들의 metric을 높이는데 치중할 수 밖에 없을거기에. 즉 영어와 주요 지표에 overfitting됐을 가능성이 높음. 그런데 지표에서도 유사한 수준이라면 실제 써봤을 때 체감은 훨씬 낮을것. (이 지점에서 service-oriented OpenAI가 대단함을 다시 한번 느끼...)
-
하지만 결국엔 이를 그대로 쓰는게 아니라 이를 기반으로 개별 용도에 맞는 파인튜닝이 시작되는 것이기에 이런 기술을 보유했던 스타트업들이 살아날 수 있는 기회이지 않을까!
- Upstage가 LLaMA 기반 파인튜닝 모델로 HuggingFaceH4/open_llm_leaderboard 2등을 달성했다는 소식 https://m.facebook.com/story.php?story_fbid=10160944522249521&id=611324520&mibextid=Nif5oz
-
대단하다! 하지만 실제 써보기 전까지 그 수준을 논하기는 어려울듯... 이유는 앞과 동일한 이유. 캐글러 출신이 많기에 지표 올리는 방향에 최적화된 모델이지 않을까 하는
-
하지만 결국 국내, 특히 대기업에 팔기 위해서는 객관적인 지표가 필요하다는 점에서, 이는 굉장히 좋고 필수불가결한 전략. 물론 전략만 있다고 다 할 수 있는게 아니니 달성했다는거 자체가 대단한 일
-
사실 가장 궁금한 부분은 학습을 위한 데이터 수집/생성을 어떻게 했을지 인데... 만약 기존에 AskUp 등에서 GPT4 등을 이용해서 생성된 데이터를 이용했다면 추후 문제가 될 수 있는 상황"