AI Wiki · 분야별 키워드

안전

AI를 안전하고 믿을 수 있게 쓰기 위한 개념입니다. 모델은 모르는 것도 그럴듯하게 지어내고(환각), 악의적인 입력에 속아 하지 말아야 할 일을 하기도 합니다(프롬프트 인젝션, 탈옥). 이런 위험을 이해하는 것이 첫걸음이고, 출력을 걸러내는 가드레일, 모델 스스로 원칙을 지키게 하는 정렬과 헌법적 AI, 워터마킹·딥페이크 탐지 같은 기술이 방어선을 이룹니다. AI 서비스를 만들거나 도입하는 입장이라면 환각과 프롬프트 인젝션 두 항목만은 꼭 읽어두시길 권합니다. 위험을 이해하고 막는 기술들을 모았습니다.