2개의 글
AI 코드리뷰는 흔한 버그를 잘 걸러내지만, 실제 버그 50개를 시험한 Greptile 벤치마크에서 최상위 도구조차 치명적 버그는 58%, 중위권 도구는 절반 수준만 잡아냈다. 탐지율이 심각도가 올라갈수록 떨어지기 때문에 'AI 리뷰 통과=안전'이라는 등식은 성립하지 않는다. 인가 흐름·비즈니스 규칙·동시성처럼 맥락이 필요한 부분은 AI 통과 여부와 상관없이 사람이 다시 확인해야 한다.
챗GPT 코딩 결과의 품질은 모델보다 프롬프트에 담은 맥락, 즉 입력·출력·제약·환경을 얼마나 구체적으로 적었는지에서 대부분 갈린다. 초보는 한 줄 요청과 요구사항 누락, 검증 없는 복사 같은 정해진 실수를 반복한다. 특히 생성된 코드에는 존재하지 않는 패키지가 섞이기도 하므로, 실행 전 패키지 실재 여부와 보안·경계 상황을 반드시 점검해야 한다.