AI & Society·Oct 19, 2023
LLM 블라인드 테스트의 가능성
LLM Boxing(블라인드 테스트)
어떤 분이 재미로 만드신듯 한데 사실 LLM 성능을 정해진 answer과 비교해서 성능을 측정하는 식의 metric은 말도 안된다고 생각하기에 Captcha처럼 잘만 디자인하면 이런 방식이 여타 LLM 리더보드보단 훨씬 신뢰할만한 리더보드가 될 수 있을듯 말하고 보니 그냥 RLHF 테스트를 Crowd방식으로 하는거군;
ai-llm
Related
AI & Society·Dec 9, 2025
카파시는 LLM을 자아를 가진 존재가 아니라 시뮬레이션 엔진으로 대해야 한다고 조언한다. 이 관점은 AI 활용법을 넘어 AI를 존재로 인식하는 문제의 해결 시작점이 될 수 있다.
AI & Society·Nov 27, 2025
똑똑한 모델이 더 쌉니다?
Opus 4.5는 토큰당 가격이 비싸지만 효율성 덕에 총비용은 더 저렴할 수 있다. 지능이 충분히 높아지면 모델 구분 자체가 사라질 것이다.
AI & Society·Oct 28, 2025
3사 AI 리서치 비교해보기
3사 AI 리서치 기능을 업무용으로 비교한 결과, 클로드가 858개 출처에서 100여 개 데이터셋을 찾아내며 압도적이었다. 정보 수집 작업에서 에이전틱 동작의 차이가 크다.