angil's Dots
angil's Dots
HomeAI & SocietyEducationChristianityEntrepreneurshipProjectsLife

Bridging knowledge and people through AI — for learning to live together.

RSSGithubFacebookLinkedIn
© 2026 Hangil Kim
© 2026 Hangil Kim
Home/AI & Society/GPT-4 128k Recall 테스트 결과
AI & Society·Nov 9, 2023

GPT-4 128k Recall 테스트 결과

GPT4-128k 모델의 Recall performance Test by Greg Kamradt

GPT4-128k 모델에 대해 넣어주는 전체 정보의 양을 늘려가면서(x축) 동시에 정답 위치를 바꿔가면서(y축) 정답을 얼마나 잘 맞추는지 accuracy를 측정한 결과네요.

물론 Paul Graham 에세이라는 하나의 데이터셋에 대한 실헌결과라 주의가 필요합니다만 요약하자면

  1. 컨텍스트에 넣어준 총 길이가 73k 이상이 되면 위치에 따라 정답이 있어도 못가져올 위험성 존재
  2. 위 1에서 위험한 위치, 즉 못가져올 확률이 높은 위치는 대략 7%-50% document depth
  • (당연하지만) 기존에 알려져있던 결과와 유사합니다. 즉 컨텍스트가 길면 정답의 위치가 중요하다 인데 이전 gpt3.5기반의 논문 결과(두번째 그림) 보다는 더 left-skewed된 U자 그래프네요. 아무래도 저렇게 긴 글들의 핵심 내용 분포 특성이 반영되어 있을듯 합니다.

  • Paul Graham의 여러 에세이를 담아 실험한 것. 즉 Multi-document QA테스트라 전체가 일정한 흐름의 소설 같은 경우는 이것보다 좋은 결과를 보이지 않을까 합니다.

  • 근데 다르게 말하면 쉬운 문제이긴 해도 73k이하에선 다 찾아온다는거...

ai-llm

Related

AI & Society·Dec 9, 2025

카파시는 LLM을 자아를 가진 존재가 아니라 시뮬레이션 엔진으로 대해야 한다고 조언한다. 이 관점은 AI 활용법을 넘어 AI를 존재로 인식하는 문제의 해결 시작점이 될 수 있다.

AI & Society·Nov 27, 2025

똑똑한 모델이 더 쌉니다?

Opus 4.5는 토큰당 가격이 비싸지만 효율성 덕에 총비용은 더 저렴할 수 있다. 지능이 충분히 높아지면 모델 구분 자체가 사라질 것이다.

AI & Society·Oct 28, 2025

3사 AI 리서치 비교해보기

3사 AI 리서치 기능을 업무용으로 비교한 결과, 클로드가 858개 출처에서 100여 개 데이터셋을 찾아내며 압도적이었다. 정보 수집 작업에서 에이전틱 동작의 차이가 크다.