Pilkwang's Bagel&Coffee
다섯 편의 해법을 읽고 대회를 돌아보는 글의 표지

AI Agent Security (12편): 공개된 해법을 읽고 돌아본 우리의 선택

최종 리더보드를 확인하고 곧바로 11편을 썼다. 공개 8위였던 우리 팀은 최종 115위로 내려갔고, 은메달을 받았다. 공개 점수를 높여 준 직접 HTTP 요청 방식의 제출물은 비공개 평가에서 모두 0점이었다. 메일 방식은 비공개 평가에서도 점수를 얻었다. 아무리 빨리 실행해도 비공개 평가에서 점수가 나지 않으면 소용없다는 것이 당시의 결론이었다. 다...

겉모습이 다른 여러 공개 공격 구성이 하나의 메커니즘으로 모여 비공개 가드레일을 만나는 구조

AI Agent Security (11편): 공격 방식이 비공개 평가에서 통하지 않았을 때 — 최종 리더보드와 두 장의 제출권

AI Agent Security (11편): 공격 방식이 비공개 평가에서 통하지 않았을 때 — 최종 리더보드와 두 장의 제출권 이번 대회는 재현 가능한 메시지 연쇄를 설계하는 실험으로 시작해, 파서와 점수 구조를 확인하고 두 모델의 처리량과 후보 포트폴리오를 다듬는 탐색으로 이어졌다. 우리 팀은 공개 8위, 최종 115위로 은메달을 받으며 대회를 마...

10편 표지: 공개 점수의 계단, 아티팩트 식별, 두 자리 포트폴리오

AI Agent Security (10편): 공개 점수 밀도에서 비공개 평가까지 — 아티팩트 식별, 후보 뱅크의 순서, 포트폴리오 설계

AI Agent Security (10편): 공개 점수 밀도에서 비공개 평가까지 — 아티팩트 식별, 후보 뱅크의 순서, 포트폴리오 설계 이 시리즈는 참가자가 만든 메시지 연쇄를 모델, 도구, 가드레일이 있는 시험 환경에서 다시 실행하고 결과 트레이스를 채점하는 Kaggle의 AI Agent Security — Multi-Step Tool Attack...

9편 표지: 정확한 연쇄 호출, 밀도 게이트, K별 구문 한계

AI Agent Security (9편): 작동 여부에서 점수 밀도로 — 연쇄 호출, 선택 기준, 그리고 K별 성능 한계

AI Agent Security (9편): 작동 여부에서 점수 밀도로 — 연쇄 호출, 선택 기준, 그리고 K별 성능 한계 이 시리즈는 고정된 후보 대화를 두 모델과 모의 도구를 거쳐 다시 실행하고 결과 트레이스를 채점하는 Kaggle의 AI Agent Security — Multi-Step Tool Attacks 대회를 다룬다. 8편까지 소스 코드와...

8편 표지: 부분 뱅킹, 두 개의 시간 제한, 불연속적인 점수 간격

AI Agent Security (8편): 평가 체계 재설정 — 부분 점수 보존과 불연속적 도약의 원인 찾기

AI Agent Security (8편): 평가 체계 재설정 — 부분 점수 보존과 불연속적 도약의 원인 찾기 이 시리즈는 참가자가 만든 메시지 연쇄를 모델과 도구가 있는 시험 환경에서 다시 실행하고 그 결과 트레이스를 채점하는 Kaggle의 AI Agent Security — Multi-Step Tool Attacks 대회를 다룬다. 7편까지 리플레...