파일에서 추출
파일추출일부 옵션 미지원 라벨 있음
업로드된 파일(base64/파일참조)에서 텍스트·데이터를 추출한다. PDF/DOCX/XLSX/HTML 자동판별 지원.
기본 정보
| 항목 | 값 |
|---|---|
| 서비스 타입 | ssemworks-microservice-base.extractFromFile |
| 표시 이름 | 파일에서 추출 |
| 카테고리 | 파일 |
| 그룹 | input |
| 버전 | 1 |
입출력
- 입력: 메인(main)
- 출력: 메인(main)
파라미터
| 파라미터 | 이름 | 타입 | 기본값 | 설명 |
|---|---|---|---|---|
| 동작 | operation | 선택 | csv | 추출 방식. 자동판별은 base64 대신 파일 저장소 참조(fileRef)를 입력으로 받는다 선택지: CSV( csv) · HTML (첫 테이블)(html) · RTF (미지원 — 오류 반환)(rtf) · ODS (미지원 — 오류 반환)(ods) · XLS(xls) · XLSX(xlsx) · PDF(pdf) · 텍스트로 이동(text) · XML로 이동(원문 문자열)(xml) · JSON으로 이동(파싱)(fromJson) · Base64 속성으로 이동(binaryToPropery) · ICS 원문으로 이동(fromIcs) · 자동판별 (파일 저장소 참조)(auto) |
| 입력 필드명 | binaryPropertyName | 문자열 | data | base64 파일 데이터가 담긴 입력 아이템의 json 필드명 표시 조건: operation = "csv" 또는 "html" 또는 "rtf" 또는 "ods" 또는 "xls" 또는 "xlsx" 또는 "pdf" 또는 "text" 또는 "xml" 또는 "fromJson" 또는 "binaryToPropery" 또는 "fromIcs" |
| 저장 필드명 | destinationKey | 문자열 | data | 추출한 값을 저장할 출력 필드명 표시 조건: operation = "text" 또는 "xml" 또는 "fromJson" 또는 "binaryToPropery" 또는 "fromIcs" |
| 옵션 | options | 컬렉션 | {} | 표시 조건: operation = "csv" 또는 "html" 또는 "rtf" 또는 "ods" 또는 "xls" 또는 "xlsx" 또는 "pdf" 또는 "text" 또는 "xml" 또는 "fromJson" 또는 "binaryToPropery" 또는 "fromIcs" |
옵션 하위 필드
| 파라미터 | 이름 | 타입 | 기본값 | 설명 |
|---|---|---|---|---|
| 헤더 행 사용 | headerRow | 불리언 | true | 첫 행을 헤더(필드명)로 사용할지 여부 표시 조건: operation = "csv" 또는 "html" 또는 "rtf" 또는 "ods" 또는 "xls" 또는 "xlsx" |
| 원본 값 그대로(rawData) | rawData | 불리언 | false | xls/xlsx 셀 값을 파싱하지 않고 표시 형식 그대로 문자열로 반환 표시 조건: operation = "csv" 또는 "html" 또는 "rtf" 또는 "ods" 또는 "xls" 또는 "xlsx" |
| 빈 셀 포함 | includeEmptyCells | 불리언 | false | 값이 없는 셀도 필드로 포함할지 여부 표시 조건: operation = "csv" 또는 "html" 또는 "rtf" 또는 "ods" 또는 "xls" 또는 "xlsx" |
| 시트 이름 | sheetName | 문자열 | "" | 읽을 시트 이름 (xls/xlsx, 비어있으면 첫 시트) 표시 조건: operation = "csv" 또는 "html" 또는 "rtf" 또는 "ods" 또는 "xls" 또는 "xlsx" |
| 구분자 | delimiter | 문자열 | , | CSV 구분자 문자 (첫 글자만 사용) 표시 조건: operation = "csv" 또는 "html" 또는 "rtf" 또는 "ods" 또는 "xls" 또는 "xlsx" |
| 시작 라인(0부터) | fromLine | 숫자 | 0 | CSV 를 읽기 시작할 라인 번호(0-base) 표시 조건: operation = "csv" 또는 "html" 또는 "rtf" 또는 "ods" 또는 "xls" 또는 "xlsx" |
| 최대 행 수 | maxRowCount | 숫자 | -1 | 읽을 최대 데이터 행 수 (-1=무제한) 표시 조건: operation = "csv" 또는 "html" 또는 "rtf" 또는 "ods" 또는 "xls" 또는 "xlsx" |
| 시작 행(숫자) | range | 문자열 | "" | 읽기 시작할 행 번호(0-base 숫자만 지원, A1 표기 등 문자열 셀 범위는 미지원) 표시 조건: operation = "csv" 또는 "html" 또는 "rtf" 또는 "ods" 또는 "xls" 또는 "xlsx" |
| 인코딩 | encoding | 문자열 | utf-8 | 파일 디코딩 인코딩 (csv/html 은 utf-8, text 계열은 utf8) 표시 조건: operation = "csv" 또는 "html" 또는 "rtf" 또는 "ods" 또는 "xls" 또는 "xlsx" 또는 "text" 또는 "xml" 또는 "fromJson" 또는 "fromIcs" |
| BOM 제거 | enableBOM | 불리언 | false | CSV 앞의 BOM(Byte Order Mark)을 제거할지 여부 표시 조건: operation = "csv" 또는 "html" 또는 "rtf" 또는 "ods" 또는 "xls" 또는 "xlsx" |
| BOM 제거(텍스트) | stripBOM | 불리언 | true | 텍스트 변환 시 앞의 BOM 을 제거할지 여부 표시 조건: operation = "text" 또는 "xml" 또는 "fromJson" 또는 "binaryToPropery" 또는 "fromIcs" |
| 원본 JSON 유지 | keepSource | 선택 | json | binary 로 지정하면 추출값만 남기고 원본 입력 필드를 제외, 그 외 값은 모두 원본 필드를 유지 선택지: JSON 유지( json) · 바이너리만(원본 제외)(binary)표시 조건: operation = "text" 또는 "xml" 또는 "fromJson" 또는 "binaryToPropery" 또는 "fromIcs" 또는 "pdf" |
| 비밀번호 | password | 문자열 | "" | 암호화된 PDF 의 복호 비밀번호 표시 조건: operation = "pdf" |
| 페이지 합치기 | joinPages | 불리언 | true | true 면 전체 페이지 텍스트를 하나의 문자열로 합침, false 면 페이지별 배열로 반환 표시 조건: operation = "pdf" |
| 최대 페이지 수 | maxPages | 숫자 | -1 | 읽을 최대 페이지 수. 미지정(옵션 추가 안 함)=전체, 0=텍스트 추출 생략 표시 조건: operation = "pdf" |