페이지 상단의 추출 엔진 섹션에서 문서 텍스트 추출에 사용할 엔진 인스턴스를 등록·관리합니다.
추출은 “엔진 하나를 전역으로 고르는” 방식이 아니라, 이름 붙은 인스턴스를 등록해 두고 프로파일에서 확장자별로 골라 쓰는 구조입니다.
1
엔진 인스턴스 등록
추출 엔진 섹션의 ”+” 버튼으로 인스턴스를 추가하고, 이름과 엔진 타입을 지정합니다. 선택할 수 있는 엔진 타입은 Tika · Docling · Document Intelligence · Mistral OCR · Google Cloud Document AI · LLM 비전 6종입니다(유형별 설명은 콘텐츠 추출 참고). 같은 타입으로 설정이 다른 인스턴스를 여러 개 등록할 수 있습니다.
2
프로파일에서 사용
등록한 인스턴스는 문서 처리 프로파일에서 기본 엔진으로 고르거나, 확장자 → 엔진 매핑에서 특정 확장자에 연결해 사용합니다.
인스턴스 이름은 등록할 때 직접 짓는 값입니다. 화면 예시의 Default - Primary, LLM Semantic - Primary 처럼 이름에 - Primary 가 붙어 있는 경우가 있는데, 이는 운영자가 그렇게 이름을 지은 것일 뿐 시스템이 붙이는 표시가 아닙니다. Cloosphere 에는 인스턴스를 “Primary”로 지정하는 기능이 없습니다 — 매핑에 없는 확장자가 쓸 엔진은 프로파일마다기본 엔진 으로 지정합니다.
프로파일마다 기본 엔진과 확장자 매핑, 청킹 설정을 지정합니다 — Primary 지정 단계는 없습니다
설정 항목
설명
기본값
이름
프로파일 식별 이름
—
기본 엔진
아래 매핑에 등록되지 않은 확장자가 사용할 엔진. 기본 내장 엔진 또는 등록해 둔 추출 엔진 인스턴스 중 선택
기본 내장 엔진
확장자 → 엔진 매핑
확장자 추가 로 행을 만들어 포맷 그룹(PDF · Word · Excel · PowerPoint · Image · HTML · Text · Email · EPUB) 또는 직접 입력한 확장자마다 엔진을 지정. 행에서도 기본 내장 엔진 을 고를 수 있음
비어 있음
텍스트 나누기
청킹 전략 (기본값(캐릭터) / 토큰(Tiktoken) / 시맨틱)
기본값(캐릭터)
Chunk 크기
분할할 청크의 크기
1000
Chunk 오버랩
청크 간 중복 크기
100
청크당 최소 토큰
이보다 작은 청크는 다음 청크와 병합. 비우거나 0 이면 비활성
비어 있음
청크당 최대 토큰
이 토큰 수를 넘는 청크는 임베딩 전에 다시 분할. 비우면 전역 기본값, 0 은 비활성
비어 있음
테이블 보존
청킹 시 표를 쪼개지 않고 앞 텍스트 청크에 붙여 유지
켜짐
문맥 보존 청킹
청크마다 문맥 요약을 덧붙여 검색 정확도를 높임(처리 비용 증가)
아래 주의 참고
문맥 보존 청킹은 문맥 모델 을 함께 지정해야 실제로 동작합니다. 새 프로파일에서는 스위치가 켜진 상태로 표시되지만 모델이 비어 있어 적용되지 않습니다. 사용하려면 모델을 고른 뒤 저장하세요. 또한 채팅에 그때그때 첨부하는 파일에는 적용되지 않고, 지식 기반에 적재하는 문서에만 적용됩니다.
2
기본 프로파일 설정
프로파일 목록에서 기본값으로 설정 버튼을 클릭하면, 해당 프로파일의 설정이 전역 기본값으로 동기화됩니다. 프로파일을 지정하지 않은 KB는 이 기본 프로파일로 처리됩니다.
3
KB에서 프로파일 선택
워크스페이스 > 지식 기반 편집 화면에서 문서 처리 프로파일을 선택합니다. 미선택 시 기본 프로파일이 적용됩니다.
신규 기능 — 각 청크에 전체 문서의 맥락 요약을 LLM이 생성하여 앞에 추가합니다. Anthropic의 Contextual Retrieval 기법을 구현한 기능입니다.
긴 문서의 뒷부분 청크에서는 앞부분의 맥락 정보가 소실되어 검색 매칭이 실패할 수 있습니다. 문맥 보존을 활성화하면:
청킹 완료 후 각 청크에 대해 LLM 호출
“이 청크가 전체 문서에서 어떤 위치와 맥락인지” 요약을 생성
요약을 청크 앞에 추가하여 벡터화
[문맥 보존 전] 청크: "결론적으로 초기 가설이 확인되었다." → "A 가설"이 뭔지 알 수 없음 → 검색 실패[문맥 보존 후] 청크: "이 청크는 A 가설 검증 보고서의 결론부이며, 50개 실험 결과를 종합한 최종 판단을 담고 있다. 결론적으로 초기 가설이 확인되었다." → 맥락 포함 → 검색 성공
설정 항목
설명
Contextual Chunking
활성/비활성 토글
모델
문맥 요약에 사용할 LLM 모델
청크 수만큼 LLM 호출이 발생합니다. 100개 청크 문서 → 100회 LLM 호출. 대용량 문서를 다수 업로드하면 API 비용이 크게 증가할 수 있습니다. 소규모 문서나 중요 문서에 선별적으로 사용하세요.