PDF 표를 마크다운으로 바꾸면 AI 추천이 19배 뛸까
BaRam
소요시간 9분
PDF를 마크다운으로 바꿨더니 45일 만에 AI 추천이 0건에서 19건으로 뛰었다는 이야기, 정말 포맷 하나 바꾼 덕분일까요? 20행짜리 표가 검색 과정에서 3~4개 청크로 나뉘면, 검색 시스템은 전체 표 대신 일부 행과 열만 가져오게 됩니다. “표 2에 나타난 바와 같이”라는 문장과 실제 표가 서로 다른 청크로 쪼개져 참조 연결이 끊기기도 하죠. 그래서 45일간 추천이 0건에서 19건으로 늘었다는 주장도 원자료와 집계 기준이 확인되기 전에는 철저한 검증 대상으로 봐야 해요.
AI 검색 마크다운 표에서 PDF가 불리해질 수 있는 이유
PDF가 문제라기보다, 표를 추출하고 검색용 청크로 나누는 과정에서 구조가 손상되는 일이 문제예요. 시각적으로는 한 표인 내용도 파서가 셀을 순서대로 추출하지 못하거나 청킹이 표의 중간에서 끊기면, 검색 시스템이 값과 헤더의 관계를 놓칠 수 있어요.
유엔대학(UNU)의 Tablemind 설명은 RAG 청킹 과정에서 20개 행으로 이뤄진 표가 3~4개 청크로 분리될 수 있다고 설명해요. 이때 모델은 일부 행이나 열만 인식해 표 전체의 맥락을 잃을 수 있어요. 표를 가리키는 본문 문구와 표가 각각 별도 청크로 나뉘면, “표 2”가 무엇을 가리키는지 검색 시스템이 연결하지 못하는 문제도 생겨요.
표 데이터는 문장 검색과도 다르게 다뤄야 해요. 벡터 임베딩 기반 검색은 의미가 비슷한 문맥을 찾는 데 초점을 두기 때문에, 특정 지표의 정확한 값을 조회하는 정밀 일치 검색에서는 관련 청크의 순위가 충분히 높지 않을 수 있어요. 즉, 문서가 검색됐는지뿐 아니라 필요한 행과 열이 함께 검색됐는지를 확인해야 해요.
PDF와 마크다운 표, 달라지는 것은 파일 확장자가 아니에요
마크다운 전환의 효과는 헤더와 행의 대응 관계, 단위, 표의 범위가 보존될 때 기대할 수 있어요. 표를 | 기호로 옮기는 데 그치면, 병합 셀이나 표 아래 주석처럼 해석에 필요한 정보가 사라질 수 있어요.
예를 들어 PDF에서 여러 행에 걸쳐 병합되어 있던 셀은 마크다운으로 옮길 때 제품 A | 1분기 | 1,000만 원, 제품 A | 2분기 | 1,200만 원처럼 행마다 범주를 명시적으로 반복해 풀어주어야 청킹 후에도 맥락이 끊기지 않습니다.
전환 뒤에는 다음을 확인하세요.
- 헤더가 각 열의 의미를 분명히 설명하는지 살펴봐요.
값,항목처럼 맥락 없이는 해석하기 어려운 이름보다 실제 속성을 쓰는 게 좋아요. - 병합 셀을 반복 값이나 명시적 범주로 풀어내요. 행마다 같은 범주를 표시하면 청크가 나뉘어도 각 행의 의미를 잃을 가능성이 줄어요.
- 단위·기간·집계 기준을 표 가까이에 둬요. 표가 본문 설명과 분리돼도 숫자를 해석할 수 있어야 해요.
- 주석과 참조 문구를 표와 연결해요. “표 2 참조”만 남기지 말고, 주석이 설명하는 열이나 조건을 함께 밝혀요.
PDF와 마크다운 중 무엇이 더 잘 검색되는지는 문서 접근성과 파서, 청킹 방식에 따라 달라질 수 있어요. Tablemind는 테이블을 일반 텍스트 청크와 분리해 구조를 보존하며 인덱싱·검색하는 접근을 소개해요. 이 설명이 보여주는 건 마크다운만이 답이라는 뜻이 아니라, 표를 검색 시스템의 독립적인 구조로 보존하는 설계가 가능하다는 점이에요.
45일간 추천 0건에서 19건, 무엇을 확인해야 할까
‘0건에서 19건’이라는 수치만으로 마크다운 전환이 원인이라고 결론 내릴 수는 없어요. 현재 확인할 수 있는 원자료가 없다면 실제 사례의 성과로 단정하지 말고, 출처와 측정 조건이 공개돼야 검증할 수 있는 주장으로 다뤄야 해요.
| 비교 항목 | 전환 전 | 전환 후 | 확인할 자료 |
|---|---|---|---|
| AI 추천 횟수 | 0건이라는 주장 | 19건이라는 주장 | 엔진별 원본 응답과 수집 기록 |
| 측정 기간 | 기준 불명 | 45일이라는 주장 | 시작·종료일, 실제 수집일 |
| 질의 조건 | 확인 필요 | 확인 필요 | 동일 질의 목록과 실행 방식 |
| 집계 기준 | 확인 필요 | 확인 필요 | 브랜드 언급·출처 인용·추천 중 무엇을 셌는지 |
전후 비교를 하려면 먼저 ‘추천 1건’의 정의부터 고정해야 해요. 브랜드 이름이 답변에 등장한 경우인지, 브랜드가 답으로 권장된 경우인지, 문서가 출처로 인용된 경우인지에 따라 숫자는 달라져요. 응답 한 건을 여러 번 세지 않도록 중복 집계 규칙도 정해야 합니다.
실무에서는 45일 관찰을 시작하기 전에 질의 목록과 엔진별 측정 방식을 기록해 두는 편이 좋아요. 예를 들어 1~15일은 기준선 측정, 그 뒤 문서 구조를 바꾸고 16~45일은 전환 후 관찰로 설계할 수 있어요. 이 기간 배분은 검증을 위한 제안이지, 0→19건 주장이 실제로 이런 방식으로 측정됐다는 뜻은 아니에요.
측정표에는 최소한 엔진, 질의, 실행일, 응답 원문, 인용 출처, 집계 여부를 남겨야 해요. 전환 전후에 질의 문구나 수집 빈도가 다르면 숫자가 달라질 수 있고, 문서의 공개 여부나 다른 콘텐츠 수정도 결과에 영향을 줄 수 있어요. 따라서 엔진별 원자료와 비교 기준이 없는 19건은 성과의 크기를 보여주는 숫자일 뿐, 원인을 증명하는 숫자는 아닙니다.
함께 읽으면 좋은 글: AI 검색 팬아웃 쿼리는 추천을 왜 바꿀까 · AI 인용 클릭률 1.8%의 함정과 전환 품질 · AI 검색에서 실종된 B2B SaaS 89곳
어떤 PDF부터 바꾸고, 무엇을 측정할까
마크다운 전환은 모든 PDF를 한꺼번에 바꾸는 작업보다, 정확한 행·열 관계가 답변에 필요한 문서부터 시험하는 편이 합리적이에요. 제품별 비교표, 요금·사양표, 기간별 지표처럼 값의 열과 행이 바뀌면 답이 달라지는 문서가 우선 후보가 될 수 있어요.
반대로 표가 단순하고, 검색 시스템이 이미 표 전체와 설명을 안정적으로 가져온다면 형식 전환의 효과가 작을 수 있어요. 모바일에서 표가 지나치게 넓어지는 문제나 사람이 업데이트하기 어려워지는 문제도 함께 살펴야 합니다. AI 답변 인용 횟수만 보지 말고, 실제 질의에 필요한 값이 정확히 검색됐는지도 확인하세요.
GEO 작업에서 마크다운 표는 만능 포맷이 아니라 구조를 검수하고 실험하기 쉬운 선택지예요. BaRam도 AI 검색 가시성을 살필 때는 언급 횟수 하나만 보기보다, 엔진별 질의와 답변에서 어떤 출처가 연결됐는지 함께 추적하는 관점이 필요해요. 자사 문서의 전환 우선순위와 측정 기준을 점검하고 싶다면 BaRam에서 살펴볼 수 있어요.
*이 콘텐츠는 AI의 도움을 받아 작성되었으며, BaRam 팀이 내용을 검토하였습니다.







