오답·판단법
공부 자료에 ‘감염’이라는 글자가 분명히 보입니다. 그런데 찾기 창에서는 결과가 없다고 나옵니다. 내용이 없는 걸까요, 검색 기능이 고장 난 걸까요? 먼저 화면에 보이는 것이 글자 모양을 찍은 이미지인지, 프로그램이 읽을 수 있는 문자 정보인지 구별해 봅니다.
가상 장면: 페이지는 사진이고 검색창은 문자를 찾는다
직접 작성한 한 장짜리 노트를 사진으로 저장해 PDF에 넣었다고 가정합니다. 사람은 사진 속 글자를 읽지만, 파일 안에 문자 정보가 없다면 검색창은 같은 방식으로 읽지 못합니다. ‘PDF’라는 확장자만으로 모든 페이지가 검색 가능하다고 판단할 수 없는 이유입니다.
W3C의 PDF7 기법은 글자 이미지로만 이루어진 스캔 문서와 실제 텍스트를 구별합니다. 원본 편집 파일을 사용할 수 없다면 OCR, 즉 광학 문자 인식으로 이미지 속 글자를 문자 정보로 변환할 수 있습니다. 다만 검색이 안 된다는 증상 하나가 항상 스캔 때문인 것은 아닙니다. 띄어쓰기·다른 표기·보이지 않는 문자 등도 확인할 수 있으므로 원인을 하나로 확정하지 않습니다.
인식이 끝났다는 표시 다음에 할 일
OCR을 실행하면 이제 어떤 단어가 검색될 수 있습니다. 그것은 문자 정보를 얻었다는 단서이지, 모든 글자가 정확하다는 합격 도장은 아닙니다. W3C의 확인 절차는 변환된 각 페이지에서 텍스트가 빠짐없이 올바르게 변환되고 읽기 순서도 맞는지 살피도록 설명합니다. 작은 글씨나 표의 두 열을 옮긴 결과도 원본과 대조합니다.
- 완전성: 제목뿐 아니라 본문·각주·표의 내용도 필요한 부분이 빠지지 않았는지 봅니다.
- 정확성: 원본의 글자와 인식된 글자를 나란히 확인합니다. 한 글자가 달라져 의미가 바뀌는 문장을 특히 주의합니다.
- 순서: 두 열의 문장이 섞이지 않았는지, 표의 항목과 값이 엇갈리지 않았는지 읽어 봅니다.
이 목록은 공부 파일을 확인하는 저자 제안입니다. 몇 개의 단어가 검색된다는 시험만으로 전체 문서의 정확성이나 접근성을 인증하는 절차는 아닙니다. 실제 처치·투약에 필요한 수치나 단위를 인식 결과만 보고 결정하지 않습니다.
‘PDF/A’로 저장하면 해결될까?
영국 정부의 문서 안내는 PDF/A의 A가 장기 보관을 위한 것이라고 설명하며, 접근성과는 구별합니다. 스캔 이미지를 그 형식으로 저장하는 것만으로 검색 가능한 글자가 생기는 것은 아닙니다. OCR로 문자 정보를 얻더라도 제목 구조나 읽기 순서 등 다른 접근성 문제가 남을 수 있습니다.
가능하다면 처음부터 실제 텍스트가 있는 원본을 활용합니다. 파일을 변환해야 한다면 원본을 보존하고 변환본과 구별해 두세요. 저작권과 이용 권한이 있는 개인 학습자료를 대상으로 하며, 환자 정보나 기관 기밀을 외부 변환 서비스에 올리라는 뜻은 아닙니다.
다음에 ‘검색 결과 없음’을 만나면 내용이 없다고 결론짓기 전에 페이지의 문자 정보를 확인해 보세요. 눈으로 읽힘, 검색됨, 정확하게 변환됨은 서로 연결되지만 같은 상태는 아닙니다.