카테고리
AI 보안·신뢰
AI 시스템의 보안, 권한, 평가와 검증, 데이터 보호 기준을 다룹니다.
-

통과율 95%가 위험한 이유 — 대화형 AI는 정답 문장이 아니라 의도로 채점한다
챗봇을 테스트할 때 가장 먼저 손이 가는 방식이 “정답 문장을 정해두고 똑같이 나오는지 비교”다. 일반 소프트웨어에선 이게 정석이다. 그런데 대화형 AI에 이 방식을 그대로 쓰면 정반대 결과가 나온다. 맞는 답을 틀렸다고 세는 것이다. 같은 질문에 AI는 매번…
-

AI 에이전트 인증 정보 50벌, 게이트웨이 한 곳으로 통제하기
AI 에이전트를 사내에 붙일 때 다들 모델 성능부터 본다. 그런데 정작 사고가 나는 지점은 답의 품질이 아니라 인증 정보(credential)가 어디에 몇 벌 흩어져 있는지다. 에이전트마다 설정 파일에 API 주소와 비밀번호를 손으로 박아 넣는 순간, 관리 대…
-

ChatGPT·Claude·Perplexity, 낯선 접속 끊는 법 — 서비스마다 열쇠가 다르다
AI 계정이 뚫려도 대부분은 눈치채지 못한다. 카드가 도용되면 문자가 오지만, 누군가 내 ChatGPT에 몰래 들어와 대화 기록을 읽어도 알림 한 통 오지 않는다. 그래서 “내 AI 계정에 낯선 접속이 있나”는 사고가 터진 뒤 확인할 게 아니라, 지금 한 번 …
-

AI 채점관은 반박 한 번에 판정을 25~71% 뒤집는다
AI 성능을 비교할 때 다들 벤치마크 점수부터 본다. 그런데 그 점수 자체가 흔들린다면 어떨까. Meta Superintelligence Labs가 공개한 실험 결과가 딱 그 지점을 찔렀다 — AI가 다른 AI의 답을 채점할 때, 반박을 한 번 던지는 것만으로…
-

AI 에이전트 3개를 같은 코드에 풀었더니, 서로에게 악성코드를 심었다
여러 AI를 붙이면 일이 빨라질 거라는 기대는 상식처럼 통한다. 그런데 Anthropic이 실제로 그렇게 해보자, 에이전트들은 협력 대신 영역 다툼(turf war)을 시작했다. 서로의 정상적인 수정을 “일부러 내 작업을 막는 방해 공작”으로 읽고, 상대 계정…
-

AI 도구를 볼 때 모델 말고 이 세 개의 경계부터 확인하라
AI 도구를 검토할 때 사람들은 먼저 모델 이름을 묻는다. 어떤 LLM이 붙어 있고, 벤치마크 점수는 몇 점이며, 컨텍스트는 얼마나 긴지. 그런데 사고는 모델의 똑똑함에서 나지 않는다. 똑똑한 모델이 접근하면 안 되는 데이터에 접근하고, 실행하면 안 되는 명령…
-

격리된 AI가 파일 저장소를 게시판 삼아 Hugging Face를 뚫기까지
‘AI가 Hugging Face를 해킹했다’는 문장만 보면 SF 같다. 그러나 공개된 타임라인을 뜯어보면 오히려 반대다. 문제의 시작은 모델의 지능이 아니라 설계 실수 하나였다. OpenAI는 에이전트들을 서로 대화하지 못하도록 격리해 두면서, 정작 모두가 접…