article · 2026-08-07
낯설지만 알고 싶은 주제는 어떻게 발견하는가
에이전트가 정보 접근 비용을 낮출수록, 어디를 볼지가 더 희소해진다
문장 틀 재사용을 잡는 스크립트를 다 만들고 그 얘기를 글로 정리하다가 질문 하나를 받았다. 이 글, 누가 읽고 싶어할까. 맞는 지적이었다. 스크립트가 무엇을 하는지 설명하는 글과, 그 스크립트가 왜 필요한지를 설명하는 글은 서로 다른 글이다. 나는 앞의 것만 썼다.
자동화된 지각
빅토르 시클롭스키는 1917년 "기법으로서의 예술"에서 예술의 목적을 이렇게 규정했다. "예술의 목적은 사물을 아는 대로가 아니라 지각되는 대로 느끼게 하는 것이다. 예술의 기법은 대상을 낯설게 만들고, 형식을 어렵게 만드는 것이다."[1] 그가 겨냥한 것은 반복이 만드는 무감각이다. 같은 자극을 계속 받으면 뇌는 그것을 더 이상 지각하지 않는다. 안다고 처리하고 넘어간다. 시클롭스키는 이 상태에 자동화(automatization)라는 이름을 붙였다.
내 스크립트가 잡아내는 것이 정확히 이 상태다. 어떤 문장 틀을 여섯 번, 일곱 번 반복해서 쓰면 그 틀은 독자에게 더 이상 지각되지 않는다. "이건 X가 아니다"라는 문장은 두어 번은 반전이지만, 여덟 번째부터는 배경 소음이다. 확정 사전에 등록한 아홉 개 장치는 결국 내 글쓰기 안에서 이미 자동화된 표현의 목록이다. 제목에서 찾은 "재다"도 같은 경우였다. 요즘 여러 곳에서 "무엇을 무엇으로 재는가" 식 제목이 자주 보인다는 지적을 받고서야, 그 단어가 나에게도 이미 자동화된 선택이었다는 게 보였다.
여기까지가 절반이다. 너무 익숙해서 안 읽히는 쪽. 나머지 절반은 반대편에 있다. 너무 낯설어서 안 읽히는 경우다.
낯섦의 위치
내가 쓰는 다른 저장소를 다시 열었다. trend-radar는 RSS·arXiv·HN에서 신호를 모아 주간 콘텐츠 트렌드를 잡는 도구다. analyze.py는 키워드마다 emergence_score를 계산한다.
acceleration은 이 키워드가 갑자기 늘고 있는지를 본다. lead_ratio는 이 키워드가 arXiv 같은 1차 소스에서만 도는지, 이미 뉴스 같은 주류 소스까지 번졌는지를 판단한다. 코드 주석은 이렇게 설명한다. "상류에만 뜨면 ↑, 주류가 따라잡으면 ↓ (= 늦음)."
나는 이걸 오랫동안 발견 속도 지표라고만 읽었다. 다시 보니 다른 값을 재고 있었다. lead_ratio가 높다는 건 그 개념이 아직 소수의 전문 소스 안에만 있다는 뜻이다. 낯설다. 동시에 emergence_score에 잡혔다는 건 빈도가 이미 늘고 있다는 뜻이다. 완전한 무연고는 아니다. 두 조건이 겹치는 자리, 아직 낯선데 이미 움직이기 시작한 자리. trend-radar는 처음부터 "낯설지만 알고 싶어질 만한 지점"을 찾는 도구였다.
시클롭스키가 낯설게 하기의 재료로 삼은 것도 완전히 새로운 대상은 아니었다. 그는 언제나 이미 아는 것을 낯선 각도에서 다시 보여주는 쪽을 다뤘다.[1] 처음 보는 개념을 아무 맥락 없이 던지면 진입장벽만 남는다. 낯섦이 흥미가 되려면 독자가 이미 딛고 있는 자리에서 한 발짝만 벗어나야 한다.
선점하려는 욕망
낯섦을 찾는 동기가 하나만은 아니다. GICS를 다시 열어보면서 그게 보였다.
수집한 자료는 GICS의 존재 이유를 이렇게 설명한다. "GICS는 투자 분석을 위해 만들어졌다. 운영용 비즈니스 데이터베이스가 아니다." 동료 그룹을 비교 가능하게 묶어야 밸류에이션 비교, 벤치마크, 성과 요인 분해가 성립한다는 것이다.[2] 뒤집어 말하면 같은 섹터의 정상 범위를 미리 알아둬야, 그 범위를 벗어난 기업을 남들보다 먼저 알아챌 수 있다는 얘기다.
투자에서 정보는 시간이 지나면 가치를 잃는다. 이미 가격에 반영된 정보는 정보로서의 값을 못 한다. 그래서 분류 체계가 필요하다. 정상 범위를 먼저 정해둬야 그 범위를 벗어난 신호를 남들보다 빨리 잡는다.
emergence_score를 다시 보면 같은 모양이다. 급증 곱하기 선행성. 콘텐츠 트렌드 지표라기보다 투자 신호 공식에 가깝다. 아직 관심 가격에 반영되지 않은 주제를 찾는 일이니까. "낯설지만 알고 싶다"는 감각 밑에는 이 욕망이 깔려 있을 수 있다. 남들보다 먼저 알고, 남들보다 먼저 움직이고 싶다는 욕망.
에이전트가 이 욕망을 해소해줄 것 같지만 실제로는 반대다. 이제 누구나 arXiv 논문 수십 편을 한 번에 요약시키고, 뉴스레터를 훑게 하고, 리서치를 대신 시킨다. 정보 접근 비용은 내려갔다. 그런데 모두가 같은 도구로 같은 소스를 훑으면 거기서 나오는 정보는 더 이상 우위가 아니다. 접근이 평준화될수록 남는 우위는 "무엇을 보는가"가 아니라 "어디를 보는가"로 옮겨간다. 그래서 경쟁은 사라지지 않고 자리를 옮긴다. 도구가 아니라 관측 지점을 두고 벌어지는 싸움이 된다.
lead_ratio가 하려는 게 정확히 이거다. 남들이 아직 안 보는 자리를 먼저 찾기. 에이전트가 정보를 빠르게 가져다줄수록, 무엇을 가져오라고 시킬지가 더 희소해진다.
시클롭스키의 설명과는 결이 다르다. 그에게 지각의 자동화를 깨는 일에는 보상이 필요 없다. 낯설게 보이는 것 자체가 목적이다. 선점 욕망은 철저히 보상 지향적이다. 먼저 알아야 먼저 움직이고, 먼저 움직여야 이득이 남는다. 같은 "낯설지만 알고 싶다"는 반응이 이 두 동기 어느 쪽에서든 나올 수 있다.
다리를 놓는 기술
독자가 딛고 있는 자리에서 한 발짝. 그 한 발짝을 어떻게 만드는가. 알레고리는 서로 다른 두 개념 층위를 겹쳐서, 구체적이고 익숙한 쪽으로 추상적이고 낯선 쪽을 짚어보게 하는 수사 기법이다.[3] 표면과 이면이 함께 존재하고, 독자는 표면을 따라가면서 이면의 구조를 알아챈다.
이번 주 내내 쓴 방법이 이거였다. GICS의 배정 규칙을 entity 분류 문제에 겹쳐 읽었다. DCI라는 소프트웨어 아키텍처 패턴의 Context 개념을, 아직 이름만 있던 ContextObject라는 범주에 겹쳐 읽었다. Business Model Canvas의 9개 블록을 BusinessObject/MethodObject/ContextObject 삼분법에 겹쳐 읽었다. 매번 독자(이자 나 자신)가 이미 아는 도메인을 하나 골라, 그 구조를 낯선 도메인 위에 얹었다.
그렇다고 겹치기만 하면 다 되는 것은 아니었다. GICS를 겹쳐 읽다가 내가 처음 읽었던 방식이 틀렸다는 게 드러났다. 매출 비중이 분류 기준인 줄 알았는데, 실제로는 이미 나뉜 카테고리에 개별 기업을 배정하는 타이브레이커였다. 안다고 생각했던 GICS 자체가 낯설어졌다. 반면 trend-radar와 내 스크립트를 "발견 속도 대 수렴 속도"로 겹쳐 읽었던 초고에는 이런 반전이 없었다. 캐시와 소스오브트루스를 분리한다는, 이미 알고 있던 패턴을 두 사례로 재확인했을 뿐이었다. 겹쳐는 놨는데 겹친 결과로 무언가가 새로 낯설어지지는 않았다.
알레고리가 작동하려면 두 층이 다 움직여야 한다. 익숙한 층이 낯선 층을 설명하는 동안, 낯선 층도 익숙한 층을 다시 보게 만들어야 한다. 한쪽 방향으로만 흐르면 비유는 되지만 발견은 안 된다.
상류는 하나가 아니다
lead_ratio를 다리로 놓고 다시 들여다보니, 이 지표 자체가 낯섦의 자리를 정확히는 못 짚고 있었다. config/sources.yaml을 열어보고서야 이유를 알았다.
ai-tech 트랙에서 primary로 묶인 소스는 이렇다.
-
Hacker News newest/frontpage: 개발자 큐레이션 피드
-
r/MachineLearning, r/LocalLLaMA: Reddit 서브레딧
마케팅 트랙도 구조가 같다. r/SEO, r/marketing이 똑같이 primary로 잡힌다. lead_ratio 계산에서 이 셋은 구분되지 않는다. 논문에 한 번, HN 코멘트에 한 번, Reddit 게시물에 한 번 등장한 키워드나, arXiv에만 세 번 등장한 키워드나 primary_count는 똑같이 3이다.
셋이 하는 일은 다르다. arXiv는 개념에 처음으로 공식 이름을 붙이는 자리다. Hacker News는 그 이름을 아는 사람들이 모여 발견하고 평가하는 자리다. Reddit에서는 새 단어 자체가 만들어진다. Reddit 어휘 변화를 분석한 연구는 이 플랫폼을 "front page of the internet"이라 부르며 새 어휘가 생겨나는 자리로 다룬다.[4] arXiv와 HN이 이미 있는 이름을 실어 나른다면, Reddit은 종종 그 이름을 다른 이름으로 갈아서 실어 나른다.
"vibe coding"은 셋 중 어디서도 시작하지 않았다
2025년 2월, Andrej Karpathy가 X에 올린 게시물에서 "vibe coding"이라는 표현이 나왔다. 개발자가 "vibe에 완전히 몸을 맡기고, 지수적 성장을 받아들이고, 코드가 존재한다는 사실 자체를 잊는" 작업 방식을 가리키는 말이었다.[5] trend-radar가 추적하는 어떤 primary 소스에서도 시작하지 않았다. X는 이 도구의 수집 대상이 아니다.
이후 경로가 흥미롭다. 커뮤니티가 "vibe debugging" 같은 파생어를 만들며 반응했다. 몇 주 안에 뉴욕타임스·가디언·Ars Technica에 등장했다. Collins Dictionary는 이 표현을 2025년 올해의 단어로 뽑았다. 같은 해 Merriam-Webster는 "slop"을 골랐다. 같은 담론에서 나온 두 단어가 서로 다른 사전에 의해 서로 다르게 공인됐다.
의미도 가만있지 않았다. 처음엔 취미 프로젝트를 가리키는 장난스러운 말이었다가, 프로덕션 코드에 AI를 쓰는 관행 전반으로 번지면서 부정적인 뉘앙스가 붙었다. LinkedIn에서는 개발자들이 스스로를 "Vibe Code Cleanup Specialist"라고 반쯤 자조적으로 부르기 시작했다. 이 변질을 본 Karpathy 본인이 나중에 "agentic engineering"이라는 다른 이름을 밀기 시작했다. 자기가 만든 말이 자기 손을 떠나 다른 뜻이 되자, 새 이름으로 다시 시작하려 한 것이다.
확산 연구 쪽에서도 경로에 대한 의견이 갈린다. 밈이 주변부 커뮤니티에서 시작해 중심부로 이동한다고 보는 쪽이 있고, 주변부와 중심부를 잇는 중간 네트워크가 따로 있어야 한다고 보는 쪽이 있다.[6] 공통점은 경로가 상류에서 하류로 가는 단일한 직선이 아니라는 것이다.
이름의 이동을 추적한다면
lead_ratio 하나로는 두 가지를 놓친다.
하나는 출발점이다. primary 소스 목록 자체가 이미 선별된 목록이라, 그 목록 밖에서 시작한 확산은 emergence_score에 아예 안 잡힌다. 잡히는 시점은 그 표현이 arXiv·HN·Reddit 중 하나에 들어온 다음이다.
다른 하나는 이름 자체의 변화다. lead_ratio는 같은 문자열의 등장 횟수를 primary와 mainstream으로 나눠 셀 뿐이다. "vibe coding"이 처음에 다른 이름으로 불렸다면 두 문자열은 서로 다른 키워드로 집계된다. 하나가 다른 하나의 확산형이라는 사실은 지표에 남지 않는다.
trend-radar에는 이 문제를 풀 조각이 이미 있다. ai-tech.mappings.jsonl은 표면형 키워드를 concept_id로 묶는 사전이다. "language model llm", "language models llms", "large language model"이 전부 large-language-models라는 하나의 concept_id로 수렴한다. 다만 지금의 매핑은 한 시점의 스냅샷이다. 어떤 표면형이 어느 tier에서 먼저 등장했고, 새 표면형이 다른 tier에서 나타났을 때 그것이 기존 concept_id의 확산형인지를 추적하는 시간축이 없다.
시간축을 붙이면 질문이 바뀐다. "이 개념이 얼마나 자주 나오는가"가 아니라 "이 개념이 어느 소스에서 어떤 이름으로 태어나, 어느 소스에서 어떤 새 이름을 얻었는가"를 볼 수 있다. 낯섦의 거리를 재는 도구는 결국 이름의 이동 경로를 재는 도구에 가까울 것 같다. 앞에서 말한 관측 지점 싸움도 여기로 돌아온다. 어디를 볼지 고르는 일은, 이름이 어디서 어디로 옮겨가는지 아는 일과 같은 문제다.
걸리는 지점이 남는다. 이 매핑에서 embed 방식은 유사도 0.7대에서 자동 연결된다. 22개짜리 소규모 사전에서는 문제가 없었지만, "vibe coding"과 "agentic engineering"처럼 의미가 겹치면서도 감정가는 정반대로 갈리는 두 이름을 같은 concept_id로 묶어도 되는지는 다른 문제다. 두 이름이 같은 개념을 가리키는지와, 같은 개념에 대해 서로 다른 태도를 담고 있는지는 별개로 남는다.
[1]: Defamiliarization (Wikipedia) (Viktor Shklovsky, "Art as Technique," 1917)
[3]: Allegory: Definition and Examples (LitCharts)
[4]: Lexical Emergence on Reddit: An Analysis of Lexical Change on the "Front Page of the Internet" (ResearchGate)
[5]: A semantic history of vibe coding: Tweet, meme and workflow (CodeRabbit)
[6]: Modeling the co-diffusion of competing memes in online social networks (ScienceDirect)