3개의 글
보안업체 해크트론이 클로드를 이용해 오픈AI의 공개 포럼 취약점과 직원 계정을 거쳐 내부 저장소까지 접근하는 데 72시간이 채 걸리지 않았다고 밝혔다. 진입점은 정교한 기법이 아니라 흔한 취약점과 계정 탈취였고, 달라진 것은 에이전트가 이 과정을 자동으로 빠르게 밀어붙였다는 점이다. AI를 업무에 쓰는 조직이라면 계정 분리와 다단계 인증, 권한 최소화 같은 기본 보안부터 점검해야 한다.
오픈AI가 미공개 모델 아스트라를 두고 컴퓨터 조작 능력이 인간 수준에 이르렀다고 밝혔다. 그러나 이 주장은 상당 부분 CEO 발언과 내부 벤치마크에 기대고 있고, 외부에서 검증된 성과는 Lean 4로 확인된 수학 증명 쪽이며 모델은 아직 일반에 공개되지 않았다. 자동화 도입을 검토한다면 독립 검증 여부와 실제 업무 환경, 권한·롤백 안전장치를 기준으로 지금 쓸 수 있는 도구부터 따지는 편이 낫다.
딥시크가 7월 말 공식 출시한 V4-Flash는 후처리를 다시 손봐 도구 호출 같은 에이전트 동작을 개선했고, 자사 발표 기준 9개 에이전트 벤치마크에서 이전 프리뷰를 크게 앞섰다. 그러나 에이전트 점수는 실행 환경에 민감해 독립 재현 전에는 벤더 자체 수치이며, 미국 정부 산하 CAISI 평가에서는 최첨단보다 약 8개월 뒤진다는 상반된 결과도 나왔다. 도입을 검토한다면 공개 벤치마크가 아니라 실제 업무 시나리오로 직접 시험하고, 가격과 한계, 법적 논란까지 함께 따져야 한다.