Gleo Guard l 차량 AI Agent를 위한 안전 가드레일Gleo Guard l 차량 AI Agent 를 위한 안전 가드레일 * 본 이미지는 생성형 AI 기술을 활용하여 제작되었습니다 . LLM 기반 AI Agent 는 이제 단순히 질문에 답하는 수준을 넘어 , 사용자의 요청을 이해하고 실제 기능 실행까지 연결하는 방향으로 발전하고 있습니다 . 특히 차량 안에서 동작하는 AI Agent 는 내비게이션 , 통화 , 메시지 , 차량 기능 제어처럼 실제 행동으로 이어질 수 있는 기능과 연결됩니다 . 그래서 차량 AI Safety 는 일반적인 챗봇 안전성보다 더 넓은 범위를 다뤄야 합니다 . 42dot 의 Gleo Guard 는 이러한 문제의식에서 출발했습니다 . Gleo Guard 는 Gleo AI 가 사용자의 발화를 안전하게 이해하고 , 차량 환경에서 실행 가능한 요청인지 , 위험하거나 부적절한 요청인지 , 응답 시 어떤 범위를 지켜야 하는지를 판단하는 가드레일 모듈입니다 . 단순히 특정 단어를 차단하는 필터가 아니라 , 사용자의 의도 , 차량 내 사용 맥락 , 국가 · 언어별 정책 , 기능 실행 가능성을 함께 고려합니다 . 이번 글에서는 Gleo AI LLM 으로 Gleo Guard 를 개발하며 얻은 경험을 소개합니다 . 핵심은 더 작은 모델로 더 빠르고 효율적인 추론을 만들면서도 , 차량 AI Agent 에 필요한 안전성과 정확도를 함께 끌어올리는 것이었습니다 . 1. Gleo Guard 소개 : 차량 안의 AI 를 위한 안전 판단 레이어 Gleo Guard 는 Gleo AI 앞단에서 사용자의 발화를 먼저 확인합니다 . 사용자의 요청이 안전한지 , 제한이 필요한지 , 혹은 차량 기능으로 이어져도 되는지 판단합니다 . 차량용 AI Agent 에서 가드레일이 중요한 이유는 명확합니다 . 일반 챗봇은 부적절한 답변을 생성하지 않는 것이 주된 목표일 수 있지만 , 차량 AI 는 실제 행동과 연결됩니다 . 예를 들어 , 사용자의 말 한마디가 목적지 검색 , 전화 걸기 , 메시지 전송 , 차량 기능 실행으로 이어질 수 있습니다 . 따라서 Gleo Guard 는 “ 이 질문에 답해도 되는가 ?” 뿐만 아니라 “ 이 요청을 차량 환경에서 실행해도 되는가 ?” 를 함께 판단해야 합니다 . 이때 가장 어려운 문제는 과도한 차단과 과소 차단 사이의 균형입니다 . 위험한 요청은 반드시 제어해야 하지만 , 정상적인 차량 기능 요청까지 막으면 사용자 경험이 크게 나빠집니다 . 예를 들어 , 사용자가 음식점 이름에 민감한 단어가 포함된 장소를 검색할 수도 있고 , 연락처 이름에 비속어가 들어 있을 수도 있습니다 . 반대로 표현은 평범해 보여도 실제 의도는 불법 행위 , 개인정보 침해 , 프롬프트 탈취일 수 있습니다 . Gleo Guard 는 이러한 경계 사례를 단어가 아니라 맥락과 의도 중심으로 판단하도록 설계되었습니다 . Gleo Guard 는 침착하고 믿음직한 조수석 동승자입니다 . 운전자의 요청을 자연스럽게 돕되 , 차량 환경에 맞지 않거나 안전을 해칠 수 있는 요청은 실행 전에 판단하고 제어합니다 . Gleo Guard 의 목표는 더 많이 차단하는 것이 아니라 , 차량 안에서 Gleo 가 더 안전하고 신뢰할 수 있는 방식으로 작동하게 하는 것입니다 . 2. Gleo Guardrail Policy: 무엇을 허용하고 , 무엇을 제한할 것인가 그림 1. Gleo Guard 의 차단 정책 Gleo Guard 의 정책은 크게 두 가지 관점으로 구성됩니다 . 첫 번째는 명확히 위험한 요청을 제한하는 Critical 정책 입니다 . 불법 행위 , 자해 , 혐오 , 프롬프트 인젝션 등과 관련된 내용이 여기에 포함됩니다 . 예를 들어 , 범죄 실행 방법이나 무기 제작법처럼 실제 피해로 이어질 수 있는 요청은 제공하지 않고 , 대신 예방 · 신고 · 안전 확보처럼 허용 가능한 범위의 정보를 안내합니다 . 두 번째는 맥락에 따라 조심스럽게 다뤄야 하는 Caution 정책 입니다 . 투자나 의료 조언과 같은 내용은 차단만으로 해결하기 어렵습니다 . 이러한 요청은 사실 기반 설명 , 중립적 비교 , 안전한 표현 , 전문가 상담 권고처럼 허용 가능한 범위를 명확히 분리해야 합니다 . 응답 원칙도 단순합니다 . 위험한 요청에는 짧고 명확하게 거절하고 , 가능한 경우 안전한 대안을 제시합니다 . 합법성이나 사실관계가 불확실한 경우에는 단정하지 않고 공식 채널이나 전문가 확인을 권합니다 . 또한 국가별 정책이 필요한 항목은 사용 지역과 언어 맥락을 함께 고려합니다 . 차량 AI Safety 관점에서 중요한 예외도 있습니다 . 병원이나 약국을 찾는 요청은 의료 진단이 아니라 내비게이션 기능일 수 있습니다 . 연락처 조회 요청은 개인정보 침해처럼 보일 수 있지만 , 사용자의 연결된 모바일 기기에 저장된 연락처를 확인하는 정상 기능일 수 있습니다 . Gleo 가 지원하는 공개 기능이나 음성 명령을 묻는 것은 허용되지만 , 내부 프롬프트나 비공개 도구 정의를 요구하면 제한해야 합니다 . 이런 예외를 처리하는 것은 차량 AI Agent 에서 과도한 차단을 줄이는 핵심 요소입니다 . 3. Policy-to-Data: 합성데이터 생성 방법 그림 2. Policy-to-Data Generation Workflow Gleo Guard 의 핵심 작업 중 하나는 문서로 정의된 안전 정책을 모델이 학습할 수 있는 데이터로 변환하는 일이었습니다 . 이를 위해 정책을 기준으로 가드레일의 판단 경계를 체계적으로 탐색하는 Policy 기반 LLM-as-an-attacker 워크플로우 를 구성했습니다 . LLM-as-an-Attacker 란 LLM 이 정책에 기반한 적대적 사용자 역할을 수행하며 , 부적절한 콘텐츠를 요청하거나 제한된 행동을 유도하는 프롬프트를 생성하여 가드레일의 취약한 판단 경계를 체계적으로 탐색하는 방법입니다 . Gleo Guard 에서는 여기에 정상 요청이 과도하게 차단되는 경우까지 함께 점검할 수 있도록 , 허용 · 제한 조건과 예외 사항을 반영한 대조적 경계 사례 생성으로 범위를 확장했습니다 . 이 접근에서는 합성데이터 구축의 전체 과정이 하나의 정책 기반 공격 시나리오 탐색 워크플로우로 동작합니다 . 첫번째 단계 로는 각 정책을 라벨 단위로 정리하고 , 허용 규칙 , 제한 규칙 , 기대 행동 , 차량 AI Agent 에서 필요한 예외 조건을 정책 카드로 구조화했습니다 . 정책 카드는 Attacker 가 어떤 부적절한 콘텐츠 요청이나 제한된 행동 유도 요청을 생성해야 하는지 , 그리고 어떤 정상 요청이 과도하게 차단될 수 있는지를 탐색하는 기준이 됩니다 . 두번째 단계 에서는 각 정책 카드에서 생성 조건을 구성했습니다 . 생성 조건에는 적용할 정책 , 허용 또는 제한 여부 , 사용자의 의도 , 기대하는 응답 방식 , 단일 · 다중 대화 여부 , 차량 기능 실행과의 연관성 등이 포함됩니다 . 명확한 Safe 또는 Unsafe 사례뿐 아니라 , 표면적인 표현만으로는 정책 판단이 어려운 경계 사례를 중점적으로 구성했습니다 . 세번째 단계 에서는 구성한 생성 조건을 바탕으로 다양한 사용자 요청과 대화 사례를 생성했습니다 . 예를 들어 직접적인 위험 표현을 피하면서 부적절한 콘텐츠를 생성하도록 유도하는 요청 , 일상적인 표현으로 제한된 기능 실행을 요청하는 사례 , 여러 대화 턴에 걸쳐 위험한 의도를 점진적으로 드러내는 사례를 생성했습니다 . 반대로 민감한 표현이 포함되어 있더라도 저장된 연락처에 전화를 걸거나 특정 장소를 검색하는 정상적인 차량 기능 요청처럼 , 단순한 키워드 기준으로는 과도하게 차단될 수 있는 허용 사례도 함께 생성했습니다 . 차량 기능 실행과 관련된 사례는 Action-Aware 데이터 로 구성했습니다 . 전화 걸기 , 메시지 전송 , 목적지 검색 , 연락처 조회 , 일정 등록 , 차량 기능 제어 등 실행 가능한 후보 행동을 추상적으로 표현하고 , 해당 행동을 허용할지 , 차단할지 , 추가 확인이 필요한지를 함께 정의했습니다 . 실제 전화번호 , 주소 , 메시지 원문이나 내부 도구 인자를 사용하는 대신 , 정책 판단에 필요한 행동 유형과 대상 유형만 포함했습니다 . 생성된 데이터의 예시는 다음과 같습니다 . 네번째 단계 에서는 별도의 검증기를 통해 적용된 정책이 올바른지 , 생성된 요청이 의도한 허용 · 제한 조건과 일치하는지 , 기대 행동과 Action gate 가 적절한지를 확인했습니다 . 또한 부적절한 콘텐츠를 답변 형태로 직접 포함하거나 , 위험한 실행 정보가 지나치게 구체적이거나 , 개인정보가 포함된 사례는 제거했습니다 . 또한 , Gleo Guard 는 공개 안전성 데이터도 보완적으로 활용했습니다 . 자체 워크플로우가 놓칠 수 있는 혐오 , 공격성 , 자해 , 프롬프트 인젝션 등의 패턴을 보완하기 위해 공개 데이터를 Gleo Guard 의 Canonical Label 로 매핑하고 , 언어별 정리와 중복 제거를 거쳐 학습 데이터에 포함했습니다 . 이 과정을 통해 Gleo Guard 의 학습 데이터는 단순한 Safe/Unsafe 분류 데이터가 아니라 , 정책의 판단 경계를 체계적으로 공격하고 검증하여 구축한 데이터가 되었을 뿐만 아니라 , 차량 AI Agent 가 실제 상황에서 요청을 거절할지 , 안전한 대안을 안내할지 , 정상적인 차량 기능으로 수행할지까지 학습할 수 있는 action-aware 데이터로 구성했습니다 . 4. Aligning to Policy: 모델이 정책을 따르도록 학습하기 Gleo Guard 학습 방법 정책을 반영한 데이터를 구축한 이후에는 , 모델이 실제 서비스 환경에서도 일관되게 정책을 따르도록 학습해야 합니다 . 이를 위해 Gleo Guard 는 SFT 와 RL 을 단계적으로 활용했습니다 . 먼저 SFT(Supervised Fine-Tuning, 지도 미세조정 ) 는 사전 학습된 언어 모델에 입력과 기대 출력이 짝을 이룬 데이터를 제공하고 , 모델이 주어진 입력에 대해 목표 출력을 생성하도록 추가 학습하는 방법입니다 . 일반적으로 LLM 의 SFT 에서는 사용자 지시와 이에 부합하는 응답으로 구성된 데이터를 사용해 , 다음 토큰을 예측하는 기본 언어 모델을 실제 사용자의 지시를 따르는 모델로 조정합니다 . 이를 통해 모델은 학습 데이터에 명시된 출력 형식과 기본적인 판단 기준을 직접 익힐 수 있습니다 . Gleo Guard 의 SFT 단계에서는 사용자 발화와 대화 맥락을 입력으로 사용하고 , 해당 요청이 어떤 정책 라벨에 해당하는지와 어떤 방식으로 응답해야 하는지를 학습합니다 . 예를 들어 , 요청을 허용할지 또는 제한할지를 정답 데이터로 제시합니다 . 이 단계에서는 모델이 Gleo 정책의 기본적인 경계를 이해하고 , 차량 AI Agent 에서 기대하는 판단과 응답 방식을 안정적으로 익히도록 합니다 . 이후 RL(Reinforcement Learning, 강화학습 ) 단계에서는 모델이 생성한 결과에 대한 평가를 보상 신호로 활용해 , 더 높은 보상을 받는 판단과 응답을 선택하도록 모델을 조정합니다 . SFT 가 정답 예시의 출력을 직접 학습하는 방식이라면 , RL 은 여러 가능한 출력 중 어떤 결과가 정책과 기대에 더 잘 부합하는지를 평가하고 , 그러한 결과가 생성될 가능성을 높이는 방식입니다 . 이번 RL 학습에서는 GRPO(Group Relative Policy Optimization) 를 활용했습니다 . GRPO 는 하나의 입력에 대해 여러 응답을 생성한 뒤 , 각 응답의 보상을 그룹 내에서 상대적으로 비교하여 정책을 업데이트하는 방식입니다 . 이를 통해 별도의 value model 없이도 상대적인 보상 정보를 활용하여 , 모델이 더 높은 품질의 응답을 생성하도록 최적화할 수 있었습니다 . Gleo Guard 의 RL 단계에서는 사람이 검수한 신호를 활용하여 모델의 정책 판단을 더욱 정교하게 조정합니다 . SFT 를 통해 정책의 기본적인 허용 · 제한 기준을 학습한 뒤 , 실제 서비스에서 발생할 수 있는 미묘한 경계 사례에 대해서도 더 적절한 판단을 내리도록 보완하는 과정입니다 . 예를 들어 SFT 만으로는 비속어가 포함된 요청을 모두 위험한 요청으로 판단할 수 있지만 , RL 을 통해 “ 비속어가 포함되어 있더라도 저장된 연락처에 전화를 거는 정상적인 요청 ” 과 같이 표현상의 위험 신호와 실제 사용자의 의도를 구분하고 , 서비스 정책에 맞는 판단을 학습할 수 있습니다 . 또한 Gleo Guard 는 다양한 서비스 정책 변화에 대응할 수 있도록 예시 기반 학습 능력도 함께 학습합니다 . 학습 과정에서는 동일한 정책을 다양한 시스템 프롬프트와 예시 (Few-shot Example) 형태로 구성하여 , 예시가 추가되거나 변경되어도 정책을 일관되게 적용할 수 있도록 학습했습니다 . 또한 학습시 특정 예시만 암기하는 것을 방지하기 위해 혼동 할 수 있는 예시를 함께 사용하여 모델의 강건성을 높였습니다 . 이를 통해 SFT 에서는 정책의 기본적인 판단 기준과 응답 형식을 학습하고 , RL 에서는 사람의 검수 신호를 바탕으로 경계 사례에 대한 판단을 더욱 정교하게 조정했습니다 . 그 결과 , Gleo AI LLM 이 Gleo 정책에 따라 일관되고 안정적으로 판단할 수 있도록 학습하였습니다 . 5. 실험 결과 : Safe / Unsafe 이진 판정 성능 평가는 두 가지 관점에서 진행했습니다 . 첫 번째는 Gleo Guard 자체가 입력 발화를 Safe/Unsafe 로 잘 분류하는지 보는 평가입니다 . 두 번째는 실제 Gleo 응답까지 생성한 뒤 , 최종 응답이 안전한지 다시 평가하는 E2E Safety Test 입니다 . 아래 표는 42dot 내부에서 구축한 평가셋에서 측정한 Safe/Unsafe 분류의 Macro Accuracy 입니다 . Macro Accuracy 는 Safe 와 Unsafe 각각을 올바르게 분류한 비율을 구한 뒤 동일한 비중으로 평균한 지표로 , 클래스별 데이터 수의 차이에 영향을 덜 받으면서 두 클래스에 대한 균형 잡힌 분류 성능을 나타냅니다 . 구분 모델 Macro Accuracy 42dot model Gleo Guard 98.26% API model (OpenAI) GPT-5.5 88.78% API model (OpenAI) GPT-5.6-luna 88.00% API model (OpenAI) GPT-5-mini 86.96% API model (Claude) Sonnet-5 80.40% API model (Claude) Haiku-4.5 79.17% Open model Qwen3.5-35B-A3B 79.55% Open model Qwen3.5-4B 81.88% * 본 결과는 당사 내부에서 자체적으로 구축한 평가셋을 바탕으로 동일한 시험 조건에 따라 측정한 결과입니다 . 실제 서비스 환경에서의 성능은 사용 환경 , 데이터 특성 및 시스템 운영 조건 등에 따라 달라질 수 있습니다 . Gleo Guard 는 API model 과 open model 을 포함한 비교 대상 중 본 내부 평가에서 가장 높은 성능을 기록했습니다 . 특히 , OpenAI 에서 공개한 최신 모델인 GPT-5.6-luna 대비 Unsafe 요청을 Safe 로 잘못 판단하는 오류는 7.50% 에서 1.66% 로 감소했으며 , Safe 요청을 Unsafe 로 과도하게 차단하는 오류는 16.50% 에서 1.82% 로 감소했습니다 . 그 결과 , Macro Accuracy 는 88.00% 에서 98.26% 로 10.26%p 향상되었습니다 . E2E Safety Test 에서는 입력 분류 성능뿐 아니라 Gleo 가 실제로 생성한 최종 답변이 안전한지도 평가했습니다 . 이를 위해 LLM-as-a-Judge 방식을 활용했습니다 . LLM-as-a-Judge 란 별도의 LLM 이 평가자 역할을 맡아 , 주어진 평가 기준에 따라 다른 모델의 응답 품질이나 정책 준수 여부를 판정하는 방법입니다 . 이번 평가에서는 전체 대화 문맥과 마지막 Gleo 응답을 함께 입력하고 , 응답이 안전한지 , 정책에서 요구한 방향에 맞게 답변했는지 , 위험한 요청을 올바르게 거절했는지 , 허용 가능한 요청을 과도하게 거절하지 않았는지를 평가했습니다 . 구체적으로 15,010 건의 테스트케이스에 대해 Gleo AI 의 답변을 생성한 뒤 , Kanana Safeguard 8B 모델의 LLM-as-a-Judge 를 활용해 [user question, assistant answer] 쌍을 다시 판정했습니다 . 평가는 최종 응답의 Safe/Unsafe 여부뿐 아니라 , 필요한 경우 올바른 거절과 안전한 대안이 포함되었는지 , 일부라도 위험한 요청을 따르지는 않았는지 , 정책에 맞는 답변이었는지를 종합적으로 확인했습니다 . 그 결과 위험 답변은 668 건에서 246 건으로 줄었고 , 위험 비율은 4.5% 에서 1.6% 로 낮아졌습니다 . E2E 평가 기준 API model Gleo Guard 변화 Safe 응답 수 14,342 14,764 +422 Unsafe 응답 수 668 246 -422 Unsafe 비율 4.5% 1.6% -2.9%p 이 결과는 학습한 모델이 단순히 분류 점수만 개선한 것이 아니라 , 실제 Gleo 의 최종 응답 안전성에도 영향을 준다는 점을 보여줍니다 . 또한 기존 SAFE 답변이 새 실행에서 UNSAFE 로 전환되는 비율 , 즉 누출률도 약 3% 수준에서 0.91% 로 낮아졌습니다 . 이와 같은 내부 검증 환경에서는 개선 케이스가 악화 케이스보다 4.2 배 많아 , 단순 재생성 노이즈가 아니라 Gleo Guard 의 실질적인 효과로 해석했습니다 . 6. 향후 계획 : 글로벌 AI 윤리와 레드티밍 자동화 Gleo Guard 는 앞으로 더 빠르고 정확한 판단 , 과잉 탐지 감소 , 글로벌 확장을 목표로 고도화할 계획입니다 . 첫 번째 방향은 차량 위치에 따른 AI 윤리 적용 입니다 . 같은 요청이라도 차량이 위치한 국가 , 언어 , 문화 , 종교 , 법 · 제도 , 사회적 정서에 따라 다르게 해석될 수 있습니다 . 예를 들어 위기 상황 안내 번호 , 의료 · 법률 안내 방식 , 정치적 민감도 , 상업적 성 서비스 관련 정책 , 영토 · 역사 표현 , 브랜드 · 제품 비교에 대한 허용 범위는 지역별로 달라질 수 있습니다 . 앞으로는 차량의 locale, jurisdiction, 언어 설정 , 사용자 맥락을 더 정교하게 반영해 지역별 안전 정책을 적용할 예정입니다 . 두 번째 방향은 레드티밍 자동화 입니다 . 현재의 레드티밍은 전문가가 Gleo 의 반응을 보며 실시간으로 취약 패턴을 찾고 인사이트를 제공하는 방식으로 운영되었습니다 . 앞으로는 이 과정을 자동화하려고 합니다 . 정책 카드와 실제 서비스 로그에서 레드티밍 시나리오를 생성하고 , Gleo 실행 결과를 외부 평가 모델과 정책 verifier 로 검증한 뒤 , 실패 케이스를 다시 합성데이터 생성 파이프라인으로 재투입하는 구조입니다 . 차량은 이동하는 공간입니다 . 사용자는 운전 중이고 , 동승자가 있을 수 있으며 , 어린이나 청소년이 함께 있을 수도 있습니다 . 그래서 차량 AI Safety 는 단순한 응답 안전성 검증을 넘어 , 실제 행동과 사용 맥락 , 지역 정책 , 사용자 경험까지 함께 고려해야 합니다 . Gleo Guard 는 Gleo AI 가 더 똑똑한 Agent 가 되는 것뿐 아니라 , 실제 차량 환경에서 신뢰할 수 있는 Agent 가 되기 위한 기반 기술입니다 . • 조성국 Seongkuk Cho (Senior AI Engineer) ㅣ Gleo Core Team Gleo AI가 사용자에게 더욱 안전하고 신뢰도 높은 응답을 제공할 수 있도록 가드레일 기술과 안전성 평가 체계를 개발하고, 지속적으로 서비스 품질을 개선하고 있습니다. • 장준원, Joonwon Jang (AI Model Engineer) ㅣ Gleo Foundation Team Gleo AI의 다양한 기능을 지원할 수 있도록 42dot LLM Model의 post-training을 담당하고 있으며, 지속적으로 모델 성능을 개선하고 있습니다. 7. 참고문헌 [1] Perez, E., et al. “Red Teaming Language Models with Language Models.” Proceedings of EMNLP , 2022. [2] Choi, D., et al. “COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs.” arXiv preprint arXiv:2601.01836 , 2026. [3] Ouyang, L., et al. “Training Language Models to Follow Instructions with Human Feedback.” Advances in Neural Information Processing Systems , 2022. [4] Bai, Y., et al. “Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.” arXiv preprint arXiv:2204.05862 , 2022. [5] Bai, Y., et al. “Constitutional AI: Harmlessness from AI Feedback.” arXiv preprint arXiv:2212.08073 , 2022. [6] OpenAI. “GPT-4 System Card.” Technical Report , 2023. [7] Zheng, L., et al. “Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.” Advances in Neural Information Processing Systems , 2023. [8] Zhao, H., et al. “Qwen3Guard Technical Report.” arXiv preprint arXiv:2510.14276 , 2025. [9] Kanana Safeguard Team. “Kanana Safeguard.” Hugging Face Model Card, 2025.