기사

AI 데이터 파이프라인: 단계와 아키텍처 가이드

AI 데이터 파이프라인은 AI 모델을 학습하고 운영하기 위해 데이터를 수집, 준비, 전달하는 과정을 자동화합니다.

AI 데이터 파이프라인은 인공지능 및 머신러닝 모델을 훈련, 접지, 운영하기 위해 데이터를 수집, 준비, 전달하는 자동화된 시스템입니다. 이는 전통적인 데이터 파이프라인을 확장하여 생산 모델을 지원하기 위해 필요한 추가 단계, 거버넌스 및 모니터링을 제공합니다.

대부분의 AI 데이터 파이프라인은 데이터를 다섯 단계를 거칩니다: 인제스팅, 준비, 훈련 또는 RAG 인덱싱, 배포, 모니터링. 인제스션은 소스 시스템에서 원시 데이터를 수집합니다. 준비는 이를 정제하고 변환합니다. 훈련 또는 인덱싱은 모델을 구축하거나 검색 인덱스를 채우는 데 사용합니다. 배포는 모델을 프로덕션에 투입합니다. 모니터링은 파이프라인과 모델 상태를 모두 추적하고 신호를 다음 사이클로 다시 전달합니다.

전통적인 데이터 파이프라인은 대시보드, 보고서, 분석 도구에 구조화된 데이터를 전달하도록 최적화되어 있습니다. AI 데이터 파이프라인은 종종 비구조화되거나 다중 모달 형태의 데이터를 머신러닝 및 생성형 AI 모델에 전달하도록 최적화되어 있습니다. 더 엄격한 계보를 강화하고, 지속적인 재학습을 지원하며, 데이터와 모델 상태를 모두 모니터링합니다. 대부분의 기업은 두 가지 모두를 운영하며, AI 파이프라인은 전통적인 파이프라인이 제공하는 거버넌스와 저장을 대체하는 대신 확장합니다.

AI 데이터 파이프라인은 여러 가지 도구 범주를 활용합니다. 인제스팅 및 오케스트레이션 도구는 데이터를 출처에서 목적지로 이동시킵니다. 데이터 준비 및 특징 엔지니어링 도구는 모델의 데이터를 정리하고 형태를 만듭니다. 특징 저장소와 벡터 저장소는 훈련, 추론, 검색 증강 생성에 사용되는 입력을 관리합니다. 관측 도구는 파이프라인 상태, 데이터 드리프트, 모델 드리프트를 추적합니다. 대부분의 생산 파이프라인은 단일 종단 플랫폼에 의존하지 않고 여러 범주를 결합합니다.

일반적인 AI 데이터 파이프라인 아키텍처 다이어그램은 다섯 단계—인제스팅, 준비, 교육 또는 인덱싱, 배포, 모니터링—의 수평 흐름을 보여주며, 모니터링에서 피드백 화살표가 다시 학습으로 이어집니다. 소스 시스템은 왼쪽에서 인제션에 반영되고; 애플리케이션과 사용자는 오른쪽에서 출력을 소비하며; 거버넌스, 계보, 접근 제어는 다섯 단계 모두 아래에 수평 계층으로 작동합니다.

머신러닝에서 파이프라인은 원시 학습 데이터를 배포된 모델로 변환하는 자동화된 단계들의 연속입니다. 일반적인 단계로는 특징 엔지니어링, 학습, 검증, 배포, 모니터링이 포함됩니다. 더 넓은 AI 데이터 파이프라인에서 머신러닝 파이프라인은 학습 또는 인덱싱 단계로, 수집부터 프로덕션 모니터링까지 이어지는 긴 체인 중 하나입니다.

알고 있어

테라데이트의 블로그를 구독하여 주간 통찰력을 얻을 수 있습니다



I consent that Teradata Corporation, as provider of this website, may occasionally send me Teradata Marketing Communications emails with information regarding products, data analytics, and event and webinar invitations. I understand that I may unsubscribe at any time by following the unsubscribe link at the bottom of any email I receive.

Your privacy is important. Your personal information will be collected, stored, and processed in accordance with the Teradata Global Privacy Statement.