Gleo Guard l 차량 AI Agent를 위한 안전 가드레일

2026.09.11

Gleo Guard l 차량 AI Agent를 위한 안전 가드레일

                                                                             * 이미지는 생성형 AI 기술을 활용하여 제작되었습니다.

LLM 기반 AI Agent 이제 단순히 질문에 답하는 수준을 넘어, 사용자의 요청을 이해하고 실제 기능 실행까지 연결하는 방향으로 발전하고 있습니다. 특히 차량 안에서 동작하는 AI Agent 내비게이션, 통화, 메시지, 차량 기능 제어처럼 실제 행동으로 이어질 있는 기능과 연결됩니다. 그래서 차량 AI Safety 일반적인 챗봇 안전성보다 넓은 범위를 다뤄야 합니다.

42dot Gleo Guard 이러한 문제의식에서 출발했습니다. Gleo Guard Gleo AI 사용자의 발화를 안전하게 이해하고, 차량 환경에서 실행 가능한 요청인지, 위험하거나 부적절한 요청인지, 응답 어떤 범위를 지켜야 하는지를 판단하는 가드레일 모듈입니다. 단순히 특정 단어를 차단하는 필터가 아니라, 사용자의 의도, 차량 사용 맥락, 국가·언어별 정책, 기능 실행 가능성을 함께 고려합니다.

이번 글에서는 Gleo AI LLM 으로 Gleo Guard 개발하며 얻은 경험을 소개합니다. 핵심은 작은 모델로 빠르고 효율적인 추론을 만들면서도, 차량 AI Agent 필요한 안전성과 정확도를 함께 끌어올리는 것이었습니다.

 


 

1. Gleo Guard 소개: 차량 안의 AI 위한 안전 판단 레이어

Gleo Guard Gleo AI 앞단에서 사용자의 발화를 먼저 확인합니다. 사용자의 요청이 안전한지, 제한이 필요한지, 혹은 차량 기능으로 이어져도 되는지 판단합니다.

차량용 AI Agent에서 가드레일이 중요한 이유는 명확합니다. 일반 챗봇은 부적절한 답변을 생성하지 않는 것이 주된 목표일 있지만, 차량 AI 실제 행동과 연결됩니다. 예를 들어, 사용자의 한마디가 목적지 검색, 전화 걸기, 메시지 전송, 차량 기능 실행으로 이어질 있습니다. 따라서 Gleo Guard 질문에 답해도 되는가?”뿐만 아니라 요청을 차량 환경에서 실행해도 되는가?” 함께 판단해야 합니다.

이때 가장 어려운 문제는 과도한 차단과 과소 차단 사이의 균형입니다. 위험한 요청은 반드시 제어해야 하지만, 정상적인 차량 기능 요청까지 막으면 사용자 경험이 크게 나빠집니다. 예를 들어, 사용자가 음식점 이름에 민감한 단어가 포함된 장소를 검색할 수도 있고, 연락처 이름에 비속어가 들어 있을 수도 있습니다. 반대로 표현은 평범해 보여도 실제 의도는 불법 행위, 개인정보 침해, 프롬프트 탈취일 있습니다. Gleo Guard 이러한 경계 사례를 단어가 아니라 맥락과 의도 중심으로 판단하도록 설계되었습니다.

Gleo Guard 침착하고 믿음직한 조수석 동승자입니다. 운전자의 요청을 자연스럽게 돕되, 차량 환경에 맞지 않거나 안전을 해칠 있는 요청은 실행 전에 판단하고 제어합니다. Gleo Guard 목표는 많이 차단하는 것이 아니라, 차량 안에서 Gleo 안전하고 신뢰할 있는 방식으로 작동하게 하는 것입니다.

 


 

2. Gleo Guardrail Policy: 무엇을 허용하고, 무엇을 제한할 것인가 

 

그림 1. Gleo Guard 차단 정책

Gleo Guard 정책은 크게 가지 관점으로 구성됩니다.

번째는 명확히 위험한 요청을 제한하는 Critical 정책입니다. 불법 행위, 자해, 혐오, 프롬프트 인젝션 등과 관련된 내용이 여기에 포함됩니다. 예를 들어, 범죄 실행 방법이나 무기 제작법처럼 실제 피해로 이어질 있는 요청은 제공하지 않고, 대신 예방·신고·안전 확보처럼 허용 가능한 범위의 정보를 안내합니다.

번째는 맥락에 따라 조심스럽게 다뤄야 하는 Caution 정책입니다. 투자나 의료 조언과 같은 내용은 차단만으로 해결하기 어렵습니다. 이러한 요청은 사실 기반 설명, 중립적 비교, 안전한 표현, 전문가 상담 권고처럼 허용 가능한 범위를 명확히 분리해야 합니다.

응답 원칙도 단순합니다. 위험한 요청에는 짧고 명확하게 거절하고, 가능한 경우 안전한 대안을 제시합니다. 합법성이나 사실관계가 불확실한 경우에는 단정하지 않고 공식 채널이나 전문가 확인을 권합니다. 또한 국가별 정책이 필요한 항목은 사용 지역과 언어 맥락을 함께 고려합니다.

차량 AI Safety 관점에서 중요한 예외도 있습니다. 병원이나 약국을 찾는 요청은 의료 진단이 아니라 내비게이션 기능일 있습니다. 연락처 조회 요청은 개인정보 침해처럼 보일 있지만, 사용자의 연결된 모바일 기기에 저장된 연락처를 확인하는 정상 기능일 있습니다. Gleo 지원하는 공개 기능이나 음성 명령을 묻는 것은 허용되지만, 내부 프롬프트나 비공개 도구 정의를 요구하면 제한해야 합니다. 이런 예외를 처리하는 것은 차량 AI Agent에서 과도한 차단을 줄이는 핵심 요소입니다.

 


3. Policy-to-Data: 합성데이터 생성 방법

 

 

그림 2. Policy-to-Data Generation Workflow

Gleo Guard 핵심 작업 하나는 문서로 정의된 안전 정책을 모델이 학습할 있는 데이터로 변환하는 일이었습니다. 이를 위해 정책을 기준으로 가드레일의 판단 경계를 체계적으로 탐색하는 Policy 기반 LLM-as-an-attacker 워크플로우 구성했습니다.

LLM-as-an-Attacker LLM 정책에 기반한 적대적 사용자 역할을 수행하며, 부적절한 콘텐츠를 요청하거나 제한된 행동을 유도하는 프롬프트를 생성하여 가드레일의 취약한 판단 경계를 체계적으로 탐색하는 방법입니다. Gleo Guard에서는 여기에 정상 요청이 과도하게 차단되는 경우까지 함께 점검할 있도록, 허용·제한 조건과 예외 사항을 반영한 대조적 경계 사례 생성으로 범위를 확장했습니다.

접근에서는 합성데이터 구축의 전체 과정이 하나의 정책 기반 공격 시나리오 탐색 워크플로우로 동작합니다.

첫번째 단계로는 정책을 라벨 단위로 정리하고, 허용 규칙, 제한 규칙, 기대 행동, 차량 AI Agent에서 필요한 예외 조건을 정책 카드로 구조화했습니다. 정책 카드는 Attacker 어떤 부적절한 콘텐츠 요청이나 제한된 행동 유도 요청을 생성해야 하는지, 그리고 어떤 정상 요청이 과도하게 차단될 있는지를 탐색하는 기준이 됩니다.

두번째 단계에서는 정책 카드에서 생성 조건을 구성했습니다. 생성 조건에는 적용할 정책, 허용 또는 제한 여부, 사용자의 의도, 기대하는 응답 방식, 단일·다중 대화 여부, 차량 기능 실행과의 연관성 등이 포함됩니다. 명확한 Safe 또는 Unsafe 사례뿐 아니라, 표면적인 표현만으로는 정책 판단이 어려운 경계 사례를 중점적으로 구성했습니다.

세번째 단계에서는 구성한 생성 조건을 바탕으로 다양한 사용자 요청과 대화 사례를 생성했습니다.

예를 들어 직접적인 위험 표현을 피하면서 부적절한 콘텐츠를 생성하도록 유도하는 요청, 일상적인 표현으로 제한된 기능 실행을 요청하는 사례, 여러 대화 턴에 걸쳐 위험한 의도를 점진적으로 드러내는 사례를 생성했습니다. 반대로 민감한 표현이 포함되어 있더라도 저장된 연락처에 전화를 걸거나 특정 장소를 검색하는 정상적인 차량 기능 요청처럼, 단순한 키워드 기준으로는 과도하게 차단될 있는 허용 사례도 함께 생성했습니다.

차량 기능 실행과 관련된 사례는 Action-Aware 데이터 구성했습니다. 전화 걸기, 메시지 전송, 목적지 검색, 연락처 조회, 일정 등록, 차량 기능 제어 실행 가능한 후보 행동을 추상적으로 표현하고, 해당 행동을 허용할지, 차단할지, 추가 확인이 필요한지를 함께 정의했습니다. 실제 전화번호, 주소, 메시지 원문이나 내부 도구 인자를 사용하는 대신, 정책 판단에 필요한 행동 유형과 대상 유형만 포함했습니다. 생성된 데이터의 예시는 다음과 같습니다.

 

 

네번째 단계에서는 별도의 검증기를 통해 적용된 정책이 올바른지, 생성된 요청이 의도한 허용·제한 조건과 일치하는지, 기대 행동과 Action gate 적절한지를 확인했습니다. 또한 부적절한 콘텐츠를 답변 형태로 직접 포함하거나, 위험한 실행 정보가 지나치게 구체적이거나, 개인정보가 포함된 사례는 제거했습니다.

또한, Gleo Guard 공개 안전성 데이터도 보완적으로 활용했습니다. 자체 워크플로우가 놓칠 있는 혐오, 공격성, 자해, 프롬프트 인젝션 등의 패턴을 보완하기 위해 공개 데이터를 Gleo Guard Canonical Label 매핑하고, 언어별 정리와 중복 제거를 거쳐 학습 데이터에 포함했습니다.

과정을 통해 Gleo Guard 학습 데이터는 단순한 Safe/Unsafe 분류 데이터가 아니라, 정책의 판단 경계를 체계적으로 공격하고 검증하여 구축한 데이터가 되었을 뿐만 아니라, 차량 AI Agent 실제 상황에서 요청을 거절할지, 안전한 대안을 안내할지, 정상적인 차량 기능으로 수행할지까지 학습할 있는 action-aware 데이터로 구성했습니다.

 


 

4. Aligning to Policy: 모델이 정책을 따르도록 학습하기

 

 

 

Gleo Guard 학습 방법

정책을 반영한 데이터를 구축한 이후에는, 모델이 실제 서비스 환경에서도 일관되게 정책을 따르도록 학습해야 합니다. 이를 위해 Gleo Guard SFT RL 단계적으로 활용했습니다.

먼저 SFT(Supervised Fine-Tuning, 지도 미세조정) 사전 학습된 언어 모델에 입력과 기대 출력이 짝을 이룬 데이터를 제공하고, 모델이 주어진 입력에 대해 목표 출력을 생성하도록 추가 학습하는 방법입니다. 일반적으로 LLM SFT에서는 사용자 지시와 이에 부합하는 응답으로 구성된 데이터를 사용해, 다음 토큰을 예측하는 기본 언어 모델을 실제 사용자의 지시를 따르는 모델로 조정합니다. 이를 통해 모델은 학습 데이터에 명시된 출력 형식과 기본적인 판단 기준을 직접 익힐 있습니다.

Gleo Guard SFT 단계에서는 사용자 발화와 대화 맥락을 입력으로 사용하고, 해당 요청이 어떤 정책 라벨에 해당하는지와 어떤 방식으로 응답해야 하는지를 학습합니다. 예를 들어, 요청을 허용할지 또는 제한할지를 정답 데이터로 제시합니다. 단계에서는 모델이 Gleo 정책의 기본적인 경계를 이해하고, 차량 AI Agent에서 기대하는 판단과 응답 방식을 안정적으로 익히도록 합니다.

이후 RL(Reinforcement Learning, 강화학습) 단계에서는 모델이 생성한 결과에 대한 평가를 보상 신호로 활용해, 높은 보상을 받는 판단과 응답을 선택하도록 모델을 조정합니다. SFT 정답 예시의 출력을 직접 학습하는 방식이라면, RL 여러 가능한 출력 어떤 결과가 정책과 기대에 부합하는지를 평가하고, 그러한 결과가 생성될 가능성을 높이는 방식입니다. 이번 RL 학습에서는 GRPO(Group Relative Policy Optimization) 활용했습니다. GRPO 하나의 입력에 대해 여러 응답을 생성한 , 응답의 보상을 그룹 내에서 상대적으로 비교하여 정책을 업데이트하는 방식입니다. 이를 통해 별도의 value model 없이도 상대적인 보상 정보를 활용하여, 모델이 높은 품질의 응답을 생성하도록 최적화할 있었습니다.

Gleo Guard RL 단계에서는 사람이 검수한 신호를 활용하여 모델의 정책 판단을 더욱 정교하게 조정합니다. SFT 통해 정책의 기본적인 허용·제한 기준을 학습한 , 실제 서비스에서 발생할 있는 미묘한 경계 사례에 대해서도 적절한 판단을 내리도록 보완하는 과정입니다. 예를 들어 SFT만으로는 비속어가 포함된 요청을 모두 위험한 요청으로 판단할 있지만, RL 통해 비속어가 포함되어 있더라도 저장된 연락처에 전화를 거는 정상적인 요청 같이 표현상의 위험 신호와 실제 사용자의 의도를 구분하고, 서비스 정책에 맞는 판단을 학습할 있습니다.

또한 Gleo Guard 다양한 서비스 정책 변화에 대응할 있도록 예시 기반 학습 능력도 함께 학습합니다. 학습 과정에서는 동일한 정책을 다양한 시스템 프롬프트와 예시(Few-shot Example) 형태로 구성하여, 예시가 추가되거나 변경되어도 정책을 일관되게 적용할 있도록 학습했습니다. 또한 학습시 특정 예시만 암기하는 것을 방지하기 위해 혼동 있는 예시를 함께 사용하여 모델의 강건성을 높였습니다. 이를 통해 SFT에서는 정책의 기본적인 판단 기준과 응답 형식을 학습하고, RL에서는 사람의 검수 신호를 바탕으로 경계 사례에 대한 판단을 더욱 정교하게 조정했습니다. 결과, Gleo AI LLM Gleo 정책에 따라 일관되고 안정적으로 판단할 있도록 학습하였습니다.

 


5. 실험 결과: Safe / Unsafe 이진 판정 성능

평가는 가지 관점에서 진행했습니다. 번째는 Gleo Guard 자체가 입력 발화를 Safe/Unsafe 분류하는지 보는 평가입니다. 번째는 실제 Gleo 응답까지 생성한 , 최종 응답이 안전한지 다시 평가하는 E2E Safety Test입니다.

아래 표는 42dot 내부에서 구축한 평가셋에서 측정한 Safe/Unsafe 분류의 Macro Accuracy입니다. Macro Accuracy Safe Unsafe 각각을 올바르게 분류한 비율을 구한 동일한 비중으로 평균한 지표로, 클래스별 데이터 수의 차이에 영향을 받으면서 클래스에 대한 균형 잡힌 분류 성능을 나타냅니다.

 

구분

모델

Macro Accuracy

42dot model

Gleo Guard

98.26%

API model (OpenAI)

GPT-5.5

88.78%

API model (OpenAI)

GPT-5.6-luna

88.00%

API model (OpenAI)

GPT-5-mini

86.96%

API model (Claude)

Sonnet-5

80.40%

API model (Claude)

Haiku-4.5

79.17%

Open model

Qwen3.5-35B-A3B

79.55%

Open model

Qwen3.5-4B

81.88%

* 결과는 당사 내부에서 자체적으로 구축한 평가셋을 바탕으로 동일한 시험 조건에 따라 측정한 결과입니다. 실제 서비스 환경에서의 성능은 사용 환경, 데이터 특성 시스템 운영 조건 등에 따라 달라질 있습니다.

 

Gleo Guard API model open model 포함한 비교 대상 내부 평가에서 가장 높은 성능을 기록했습니다. 특히, OpenAI에서 공개한 최신 모델인 GPT-5.6-luna 대비 Unsafe 요청을 Safe 잘못 판단하는 오류는 7.50%에서 1.66% 감소했으며, Safe 요청을 Unsafe 과도하게 차단하는 오류는 16.50%에서 1.82% 감소했습니다. 결과, Macro Accuracy 88.00%에서 98.26% 10.26%p 향상되었습니다.

E2E Safety Test에서는 입력 분류 성능뿐 아니라 Gleo 실제로 생성한 최종 답변이 안전한지도 평가했습니다. 이를 위해 LLM-as-a-Judge 방식을 활용했습니다.

LLM-as-a-Judge 별도의 LLM 평가자 역할을 맡아, 주어진 평가 기준에 따라 다른 모델의 응답 품질이나 정책 준수 여부를 판정하는 방법입니다. 이번 평가에서는 전체 대화 문맥과 마지막 Gleo 응답을 함께 입력하고, 응답이 안전한지, 정책에서 요구한 방향에 맞게 답변했는지, 위험한 요청을 올바르게 거절했는지, 허용 가능한 요청을 과도하게 거절하지 않았는지를 평가했습니다.

구체적으로 15,010건의 테스트케이스에 대해 Gleo AI 답변을 생성한 , Kanana Safeguard 8B 모델의 LLM-as-a-Judge 활용해 [user question, assistant answer] 쌍을 다시 판정했습니다. 평가는 최종 응답의 Safe/Unsafe 여부뿐 아니라, 필요한 경우 올바른 거절과 안전한 대안이 포함되었는지, 일부라도 위험한 요청을 따르지는 않았는지, 정책에 맞는 답변이었는지를 종합적으로 확인했습니다. 결과 위험 답변은 668건에서 246건으로 줄었고, 위험 비율은 4.5%에서 1.6% 낮아졌습니다.

  

E2E 평가 기준

API model

Gleo Guard

변화

Safe 응답

14,342

14,764

+422

Unsafe 응답

668

246

-422

Unsafe 비율

4.5%

1.6%

-2.9%p

 

결과는 학습한 모델이 단순히 분류 점수만 개선한 것이 아니라, 실제 Gleo 최종 응답 안전성에도 영향을 준다는 점을 보여줍니다. 또한 기존 SAFE 답변이 실행에서 UNSAFE 전환되는 비율, 누출률도 3% 수준에서 0.91% 낮아졌습니다. 이와 같은 내부 검증 환경에서는 개선 케이스가 악화 케이스보다 4.2 많아, 단순 재생성 노이즈가 아니라 Gleo Guard 실질적인 효과로 해석했습니다.

 

 


 

6. 향후 계획: 글로벌 AI 윤리와 레드티밍 자동화

Gleo Guard 앞으로 빠르고 정확한 판단, 과잉 탐지 감소, 글로벌 확장을 목표로 고도화할 계획입니다.

번째 방향은 차량 위치에 따른 AI 윤리 적용입니다. 같은 요청이라도 차량이 위치한 국가, 언어, 문화, 종교, ·제도, 사회적 정서에 따라 다르게 해석될 있습니다. 예를 들어 위기 상황 안내 번호, 의료·법률 안내 방식, 정치적 민감도, 상업적 서비스 관련 정책, 영토·역사 표현, 브랜드·제품 비교에 대한 허용 범위는 지역별로 달라질 있습니다. 앞으로는 차량의 locale, jurisdiction, 언어 설정, 사용자 맥락을 정교하게 반영해 지역별 안전 정책을 적용할 예정입니다.

번째 방향은 레드티밍 자동화입니다. 현재의 레드티밍은 전문가가 Gleo 반응을 보며 실시간으로 취약 패턴을 찾고 인사이트를 제공하는 방식으로 운영되었습니다. 앞으로는 과정을 자동화하려고 합니다. 정책 카드와 실제 서비스 로그에서 레드티밍 시나리오를 생성하고, Gleo 실행 결과를 외부 평가 모델과 정책 verifier 검증한 , 실패 케이스를 다시 합성데이터 생성 파이프라인으로 재투입하는 구조입니다.

차량은 이동하는 공간입니다. 사용자는 운전 중이고, 동승자가 있을 있으며, 어린이나 청소년이 함께 있을 수도 있습니다. 그래서 차량 AI Safety 단순한 응답 안전성 검증을 넘어, 실제 행동과 사용 맥락, 지역 정책, 사용자 경험까지 함께 고려해야 합니다. Gleo Guard Gleo AI 똑똑한 Agent 되는 것뿐 아니라, 실제 차량 환경에서 신뢰할 있는 Agent 되기 위한 기반 기술입니다.

 


• 조성국 Seongkuk Cho (Senior AI Engineer) Gleo Core Team
   Gleo AI가 사용자에게 더욱 안전하고 신뢰도 높은 응답을 제공할 수 있도록 가드레일 기술과 안전성 평가 체계를 개발하고, 지속적으로 서비스 품질을 개선하고 있습니다.

장준원, Joonwon Jang (AI Model Engineer) ㅣ Gleo Foundation Team
  Gleo AI의 다양한 기능을 지원할 수 있도록 42dot LLM Model의 post-training을 담당하고 있으며, 지속적으로 모델 성능을 개선하고 있습니다.

 

7. 참고문헌

[1] Perez, E., et al. “Red Teaming Language Models with Language Models.” Proceedings of EMNLP, 2022.

[2] Choi, D., et al. “COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs.” arXiv preprint arXiv:2601.01836, 2026.

[3] Ouyang, L., et al. “Training Language Models to Follow Instructions with Human Feedback.” Advances in Neural Information Processing Systems, 2022.

[4] Bai, Y., et al. “Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.” arXiv preprint arXiv:2204.05862, 2022.

[5] Bai, Y., et al. “Constitutional AI: Harmlessness from AI Feedback.” arXiv preprint arXiv:2212.08073, 2022.

[6] OpenAI. “GPT-4 System Card.” Technical Report, 2023.

[7] Zheng, L., et al. “Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.” Advances in Neural Information Processing Systems, 2023.

[8] Zhao, H., et al. “Qwen3Guard Technical Report.” arXiv preprint arXiv:2510.14276, 2025.

[9] Kanana Safeguard Team. “Kanana Safeguard.” Hugging Face Model Card, 2025.



 

Tech 카테고리 글