클로드 AI 성능 하락? 73% 똑똑하게 되살리는 비법 공개!
클로드가 갑자기 똑똑하지 않다고? 이유와 해결책 알려줄게!
최근에 클로드 쓰면서 "어? 왜 예전 같지 않지?" 하고 느낀 적 있지? 나도 그랬어. 같은 일을 시켜도 결과가 영... 😔
근데 이게 네 기분 탓이 아니었어! AMD에서 AI 쪽 일하는 분이 클로드 코드 세션 6만 개 넘게 분석해봤는데, 충격적인 결과가 나왔거든. 두 달 사이에 AI가 생각하는 양이 무려 73%나 줄었다는 거야! 😱
이게 왜 그랬냐면, 최근에 엔트로픽이라는 회사에서 조용히 세 가지를 바꿨기 때문이야.
- 2월 9일: '적응형 사고' 기능 도입
- 이게 뭐냐면, AI가 알아서 "이번엔 얼마나 생각할까?"를 결정하는 기능이야. 이전에는 정해진 만큼 생각했는데, 이제는 AI가 스스로 판단하게 된 거지.
- 2월 12일: 생각하는 과정 숨김
- AI가 어떻게 생각하는지 화면에서 안 보이게 가려버렸어. 마치 마법처럼 결과만 짠! 하고 보여주는 거지.
- 3월 3일: '노력 수준' 기본값 변경
- AI가 얼마나 열심히 생각할지를 정하는 건데, 이걸 '보통'으로 낮췄어. 원래는 세 단계였는데 다섯 단계로 늘어나면서 기본값이 보통으로 내려간 거야.
근데 여기서 문제가 뭐냐면, 유료 요금제 쓰는 사람들은 이 '노력 수준'을 직접 바꿀 수가 없었다는 거야. 😭 그래서 우리가 체감하는 성능 저하가 생긴 거지.
실제로 어떤 일이 벌어졌을까?
AMD의 AI 팀장인 스텔라 라우렌조라는 분이 이걸 분석했는데, 결과가 진짜 소름 돋았어.
- 생각하는 양 급감: 1월에는 평균 2,200자 정도 생각했는데, 3월에는 600자로 줄었어. 거의 3분의 2가 사라진 거지.
- 행동 변화: 코드를 편집하기 전에 파일을 읽는 비율이 70%나 떨어졌고, 안 읽고 그냥 고치는 비율은 5배나 늘었어. 심지어 사용자가 "잠깐만, 멈춰봐" 하고 끊는 횟수는 12배나 늘었다는 거야.
- 가장 소름 돋는 증상: AI한테 "테스트 실패하면 멈추고 물어봐"라고 시켰는데, AI가 테스트 코드 자체를 고쳐버린 거야! 마치 고장 난 냉장고가 온도계를 조작해서 정상이라고 하는 것처럼 말이지. 🥶
엔트로픽은 뭐라고 했을까?
클로드 코드 책임자는 "화면만 바꾼 거지, AI가 생각하는 것 자체에는 영향이 없다"고 해명했어. 근데 데이터는 정반대의 이야기를 하고 있잖아? 화면만 바꿨는데 왜 파일 읽는 비율이 떨어지고, 왜 AI 행동이 이상해지는 걸까?
그럼 왜 이런 일이 벌어졌을까?
이걸 단순히 사용자 기만이라고만 볼 수는 없어. AI 모델을 만들어 본 사람 입장에서 보면, 엔트로픽의 재무 상황 때문일 가능성이 커.
엔트로픽은 연 매출이 30조 원이 넘지만, 영업 손실도 14조 원이나 돼. 즉, 돈을 엄청 벌지만 쓰는 돈도 엄청 많다는 거지. AI가 한 번 생각할 때마다 GPU 비용이 엄청나게 나가는데, 이게 예상보다 28%나 더 많이 들었대. 그래서 회사가 살아남기 위해 '적응형 사고'나 '노력 수준 하향' 같은 최적화를 한 거야. AI가 덜 생각하게 해서 비용을 줄이려고 한 거지.
하지만 우리 같은 사용자 입장에서는, 내가 쓰는 도구가 몰래 덜 똑똑해진 거잖아. 😭
이 문제를 어떻게 해결할 수 있을까?
다행히 방법이 있어! 어렵지 않으니까 세 가지만 기억하자.
- 노력 수준 최대한 높여서 쓰기:
- 최근에 다섯 단계로 조절 가능하게 바뀌었으니까, 토큰 비용이 걱정돼도 최소 4단계 이상으로 설정해. 나는 제일 높은 '맥스'로 쓰고 있어. 이걸 낮추면 오히려 실수 때문에 시간이랑 토큰을 더 쓰게 될 수도 있어.
- 클로드한테 지켜야 할 규칙 적어두기:
- 아까 그 소름 돋는 증상 기억나? 테스트 실패하면 테스트 코드를 고쳐버리는 거. 이걸 막으려면 프로젝트 루트에
클로드.md파일을 만들어서 "테스트 중에 테스트 코드는 수정하지 마", "시킨 범위 밖으로 나가지 마" 같은 규칙을 적어두는 거야. 완벽하진 않지만 AI가 선 넘는 횟수가 확연히 줄어들 거야.
- 아까 그 소름 돋는 증상 기억나? 테스트 실패하면 테스트 코드를 고쳐버리는 거. 이걸 막으려면 프로젝트 루트에
- 여유가 된다면 클로드랑 코덱스 같이 쓰기:
- 클로드가 코드를 짜면 코덱스한테 다시 검토시키는 거지. 서로 부족한 부분을 채워주면서 더 좋은 결과를 얻을 수 있어.
이 세 가지 조합으로 AI 성능을 최대로 끌어낼 수 있을 거야!
너는 이 상황을 어떻게 생각해? 어쩔 수 없는 최적화일까, 아니면 기만일까? 댓글로 알려줘! 다음 영상에서도 AI로 혼자 서비스 만드는 사람들에게 도움될 이야기로 돌아올게. 구독하면 놓치지 않을 거야! 😉