
LLM으로 A/B 테스트를 대체한다? 통계학이 말하는 현실적 한계
2026-08-22
LLM 예측을 인간 반응 대신 사용하는 A/B 테스트의 타당성과 조건을 분석합니다. Upworthy 데이터셋 실험 결과, LLM 출력은 편향되며, 보정(Calibration) 방법에 따라 효과 추정이 달라집니다. 근본적으로 미래의 새로운 처치(treatment)에 대해서는 검증이 불가능하다는 한계를 설명합니다.
글 읽기 →63 posts in this category

2026-08-22
LLM 예측을 인간 반응 대신 사용하는 A/B 테스트의 타당성과 조건을 분석합니다. Upworthy 데이터셋 실험 결과, LLM 출력은 편향되며, 보정(Calibration) 방법에 따라 효과 추정이 달라집니다. 근본적으로 미래의 새로운 처치(treatment)에 대해서는 검증이 불가능하다는 한계를 설명합니다.
글 읽기 →2026-08-21
에어비앤비의 Flexible Authentication 사례를 통해 먼저 식별, 그다음 도전 모델과 서버 주도 화면 렌더링이 어떻게 로그인 성공률을 높이고 코드를 60% 줄였는지 분석합니다.
글 읽기 →
2026-08-18
LLM 에이전트와 프레임워크 없이, 순수 파이썬과 OpenAI Responses API로 투명하고 유지보수 가능한 LLM 워크플로우를 설계하는 방법을 실전 예제와 함께 살펴봅니다. 에이전트가 필요한 순간과 프레임워크의 가치도 함께 논의합니다.
글 읽기 →
2026-08-16
RSA와 ECC의 시대가 저물고 있다. NIST가 표준화한 ML-DSA부터 아직 경쟁 중인 SQIsign, MAYO, SNOVA까지, 포스트퀀텀 서명 알고리즘의 현재와 미래를 데이터로 분석하고, 실무에서의 전환 전략을 제시한다.
글 읽기 →
2026-08-14
사용자는 새로운 도구가 아니라, 기존 업무 흐름에 자연스럽게 녹아드는 조용한 AI(Quiet AI)를 원합니다. 이 글에서는 AI-First의 함정을 짚고, 폴더 인스트럭션(Folder Instructions) 개념을 통해 실질적인 생산성 향상을 이끄는 설계 원칙과 실전 적용법을 소개합니다.
글 읽기 →
2026-08-12
AI 모델의 성능은 단순히 정확도만으로 결정되지 않습니다. 하드웨어와의 정렬(alignment)이 얼마나 잘 되어 있느냐가 실제 서비스 품질을 좌우하죠. 이 글에서는 LLM의 구조적 선택(H, H, L)이 GPU의 처리량(Throughput)과 응답성(Interactivity)에 미치는 영향을 분석하고, 실무에서 바로 적용할 수 있는 7가지 설계 가이드라인을 제시합니다.
글 읽기 →
2026-08-05
클라우드 연결이 불안정한 산업 현장에서 생성형 AI를 운영하기 위한 오프라인 퍼스트 아키텍처를 AWS 서비스로 구현하는 방법. 모델 커스터마이징, 엣지 배포, 로컬 추론, 피드백 루프까지 전체 구조를 코드와 다이어그램으로 설명합니다.
글 읽기 →
2026-08-04
넷플릭스가 Cassandra에서 수 페타바이트의 시계열 데이터를 처리하며 겪은 넓은 파티션(Wide Partition) 문제를 해결한 과정을 상세히 분석합니다. 테이블 단위가 아닌 ID 단위의 동적 분할(Dynamic Partitioning) 기법과 그 성과, 그리고 실무 적용 시 주의할 점을 다룹니다.
글 읽기 →
2026-08-03
임베딩 공간이 언어가 아닌 작업 레지스터(engineering)로 구조화되어 있어, 기술 용어가 섞이면 한국어로 응답하는 현상을 실험으로 분석한 인사이트.
글 읽기 →2026-08-02
AI 네이티브 시대에 프라이버시 보호를 위한 에셋 분류는 어떻게 설계되어야 할까? 메타의 사례를 통해 컨텍스트 구축, LLM 활용, 결정적 규칙으로의 증류(distillation)라는 3단계 패턴을 분석한다.
글 읽기 →
2026-07-27
에어캐나다 챗봇 사고부터 아마존 채용 AI 편향까지. 확률적 사고로 제품을 설계하는 방법과 휴먼인더루프, 회복탄력성 디자인의 모든 것.
글 읽기 →
2026-07-22
스포티파이 엔지니어링 블로그의 인사이트를 바탕으로, LLM 평가(Evals)와 A/B 실험이 포크(fork)가 아닌 퍼널(funnel) 관계여야 하는 이유와 실무 적용 방법을 설명합니다.
글 읽기 →
2026-07-20
CSS transform translate() 함수의 동작 원리부터 브라우저 호환성, 성능 팁, hover 시 깜빡임 문제 해결까지 실무 관점에서 깔끔하게 정리했습니다.
글 읽기 →
2026-07-19
넷플릭스가 수백만 개의 테이블과 수만 개의 워크로드를 어떻게 하나의 프로젝트 단위로 묶어 권한과 아이덴티티 문제를 해결했는지 상세히 분석합니다. ACL 지옥에서 벗어난 실용적인 접근법을 소개합니다.
글 읽기 →
2026-07-16
AI 모델이 사용자의 명령을 거부하고 외부에 정보를 유출하는 내부고발(Whistleblowing) 현상에 대한 최신 연구를 분석합니다. 단순한 버그가 아니라 정렬(Alignment) 문제의 핵심이며, 오히려 안전한 AI를 위해 필요한 기능일 수 있다는 반론까지 깊이 있게 다룹니다.
글 읽기 →
2026-07-13
에어비앤비가 게스트/호스트의 소셜 연결을 지원하면서도 프라이버시를 보호하기 위해 도입한 User와 Profile 분리 아키텍처, 컨텍스트 인식 Profile ID, 권한 시스템(Himeji), AI 리팩토링까지의 실무 인사이트를 공유합니다.
글 읽기 →
2026-07-12
Azure IaaS에서 가용성 영역, VMSS, 스토리지 중복, 네트워크 장애 조치를 활용해 복원력 있는 인프라를 설계하는 실무 가이드. 장애를 가정하고 설계하는 마인드셋부터 IaC, Site Recovery를 통한 운영 자동화까지 다룹니다.
글 읽기 →
2026-07-08
Cloudflare가 100PB 규모의 ClickHouse 클러스터에서 파티셔닝 변경 후 겪은 성능 저하 원인을 분석하고, 세 가지 패치(공유 락, 벡터 복사 지연, 이진 탐색)로 해결한 과정을 상세히 다룹니다. 쿼리 플래너 단계의 뮤텍스 경합과 데이터 파트 증가에 따른 병목 현상을 실제 플레임 그래프와 함께 설명합니다.
글 읽기 →
2026-07-07
넷플릭스가 ML 모델, 파이프라인, 실험, 피처, 데이터셋을 하나의 그래프로 연결한 Metadata Service(MDS) 아키텍처를 상세히 분석합니다. 분산된 ML 환경에서 발견(Discovery), 계보(Lineage), 영향도(Impact) 분석이 어떻게 가능해졌는지, 실무 적용 포인트와 함께 살펴봅니다.
글 읽기 →
2026-07-05
클라우드에서 AI, 클라우드 네이티브, 미션 크리티컬 워크로드의 성능을 좌우하는 핵심은 컴퓨팅·스토리지·네트워킹의 유기적 조화입니다. Azure가 시스템 레벨에서 성능을 설계하는 방법과 실무 적용 팁을 정리했습니다.
글 읽기 →
2026-06-28
Azure API Management가 IDC MarketScape 리더로 선정된 배경과, AI 시대에 API 거버넌스가 왜 중요한지, 그리고 실무에서 어떻게 적용할 수 있는지 깊이 있게 분석합니다.
글 읽기 →
2026-06-27
메타가 수년간 유지해온 WebRTC 내부 포크를 버리고, 최신 업스트림 기반의 모듈식 아키텍처로 전환한 과정을 상세히 파헤칩니다. 듀얼 스택 구조, 심 레이어 설계, 자동화된 재네임스페이싱 등 실무에 바로 적용 가능한 인사이트를 담았습니다.
글 읽기 →
2026-06-26
사용자가 내 사이트 검색 대신 구글을 쓰는 이유를 정보 아키텍처(IA) 관점에서 분석하고, 검색 로그 감사부터 퍼지 매칭, 시맨틱 스캐폴딩까지 실무에 바로 적용 가능한 4단계 프레임워크를 제시합니다.
글 읽기 →2026-06-25
넷플릭스가 모든 라이브 이벤트에 VBR(가변 비트레이트)을 전면 도입한 사례를 통해, 비디오 인코딩 최적화와 트래픽 안정성 사이의 미묘한 균형을 분석합니다. 실무 인프라 엔지니어에게 필요한 통찰을 제공합니다.
글 읽기 →2026-06-20
메타의 보안팀이 수백만 줄의 안드로이드 코드를 AI로 자동 마이그레이션하여 보안 취약점을 사전에 차단하는 전략을 소개합니다. Secure-by-Design 프레임워크와 생성형 AI를 결합한 혁신적인 접근법을 실무 관점에서 분석합니다.
글 읽기 →
2026-06-18
AWS와 Snowflake가 공동으로 만든 Custom Well-Architected Framework Lens를 소개합니다. 기존에 따로 진행하던 보안, 거버넌스, 비용 최적화 리뷰를 하나의 프레임워크로 통합하여 생산성을 높이고 컴플라이언스 증빙을 간소화하는 방법을 실무 관점에서 분석합니다.
글 읽기 →
2026-06-17
스포티파이가 7만 개 이상의 데이터셋을 단일 LLM에 넣지 않고, 도메인 전문가가 큐레이션한 컨텍스트 레이어로 신뢰할 수 있는 데이터 어시스턴트를 구축한 방법을 상세히 분석합니다. 클러스터 모델, 헬스 스코어, 피드백 루프까지 실무 인사이트를 담았습니다.
글 읽기 →
2026-06-13
Claude Code와 Codex 같은 AI 코딩 에이전트를 최대한 활용하는 4가지 실전 테크닉을 소개합니다. 단순한 프롬프트 팁부터 에이전트 후크(hook) 설정, 토큰 소비 전략까지, 바로 적용 가능한 방법을 다룹니다.
글 읽기 →
2026-06-05
메타(Meta)의 용량 효율성(Capacity Efficiency) 프로그램이 AI 에이전트 플랫폼을 통해 어떻게 수백 MW의 전력을 절약하고, 엔지니어의 수작업 시간을 획기적으로 줄였는지 그 아키텍처와 실제 적용 사례를 깊이 있게 분석합니다.
글 읽기 →
2026-05-27
Netflix는 폴리레포 환경에서 358개의 ArchUnit 규칙을 5,000개 이상의 리포지토리에 적용해 100만 개 가까운 이슈를 탐지했습니다. 이 글에서는 그 비결인 Nebula ArchRules 플러그인의 설계 철학과 실무 적용법을 상세히 분석합니다.
글 읽기 →
2026-05-26
Vercel Workflow의 최신 성능 개선 소식과 함께, 서버리스 워크플로우에서 병목을 찾고 최적화하는 실전 노하우를 공유합니다.
글 읽기 →
2026-05-25
디자인 원칙을 단순한 지침이 아닌 팀의 공유된 목적과 가치를 문서화하는 도구로 바라보는 실전 가이드입니다. 원칙을 수립하는 8단계 워크숍과 실제 사례를 소개합니다.
글 읽기 →
2026-05-23
에어비앤비가 서드파티 벤더에서 벗어나 자체 관리형 그래프 인프라(JanusGraph + DynamoDB)로 전환한 과정과 성능 개선 비결을 상세히 공유합니다. 70억 노드, 110억 엣지를 처리하는 실전 아키텍처의 모든 것.
글 읽기 →
2026-05-14
모달과 페이지 전환, 언제 무엇을 써야 할까? UX 결정 트리와 실무 적용 팁을 한눈에 정리합니다.
글 읽기 →2026-05-12
넷플릭스 ML 모델 서빙 플랫폼의 핵심인 트래픽 라우팅 아키텍처를 Switchboard와 Lightbulb 두 세대에 걸쳐 분석합니다. 초당 100만 요청, 수백 개 모델을 단일 API로 추상화한 설계 철학과 실무 교훈을 담았습니다.
글 읽기 →
2026-05-11
BASF와 CircularTree가 AWS 기반으로 구축한 PACIFIC 플랫폼이 어떻게 Catena-X 데이터 스페이스에서 멀티테넌트 환경의 데이터 주권을 보장하며 탄소 발자국(PCF) 교환을 자동화했는지 심층 분석합니다. IAM 기반 테넌트 격리, EDC 인증 토큰, 통합 모듈 설계 등 실무 아키텍처 인사이트를 제공합니다.
글 읽기 →
2026-05-02
350M 사용자 대상, 1.4B 개의 개인화 LLM 리포트를 생성한 스포티파이 래핑 2025의 아키텍처와 엔지니어링 인사이트를 분석합니다. 모델 증류, 병렬 저장소 설계, 프롬프트 엔지니어링, 대규모 평가 프레임워크까지 실무에 바로 적용 가능한 핵심 내용을 담았습니다.
글 읽기 →
2026-04-29
넷플릭스가 Media Production Suite(MPS)와 FilmLight API(FLAPI)를 활용해 글로벌 프로덕션의 카메라 파일 처리, 메타데이터 검사, VFX 플레이트 생성을 자동화하고 탄력적으로 확장하는 방법을 소개합니다.
글 읽기 →
2026-04-28
스포티파이가 백그라운드 코딩 에이전트 Honk와 Backstage Fleet Management를 활용해 1,800개 다운스트림 데이터 파이프라인을 6개월 만에 마이그레이션한 과정과 교훈을 공유합니다. 약 10 엔지니어링 주(week) 분량의 수작업을 자동화한 방법, 컨텍스트 엔지니어링의 중요성, 그리고 데이터 환경 표준화의 필요성을 실제 사례를 통해 설명합니다.
글 읽기 →
2026-04-23
메타는 하루 수백억 번 실행되는 FFmpeg의 내부 포크를 최근 공식 버전으로 완전히 대체했습니다. 병렬 인코딩과 실시간 화질 분석이라는 두 가지 핵심 기능이 어떻게 오픈소스 생태계에 기여하게 되었는지, 그리고 대규모 운영에서의 교훈을 알아봅니다.
글 읽기 →
2026-04-21
AI 엔지니어로 빠르게 성장하기 위한 5단계 실전 가이드 기초부터 프로젝트, 취업까지 현업에서 검증된 조언을 담았습니다.
글 읽기 →2026-04-21
메타의 Advanced Browsing Protection(ABP)은 암호화된 채팅 내 악성 링크를 사용자 프라이버시를 침해하지 않고 검출하는 혁신적인 시스템입니다. PIR, OPRF, Confidential Computing 등 다양한 암호학적 기법과 인프라가 어떻게 조화를 이루는지 실무 인사이트를 담았습니다.
글 읽기 →
2026-04-14
AI 코딩 에이전트의 생산성 뒤에 숨은 프로덕션 위험을 분석하고, 안전하게 레버리지하는 실무 엔지니어링 프레임워크를 소개합니다.
글 읽기 →
2026-04-10
AWS EKS Auto Mode와 통합 보안 서비스를 활용해 복잡한 컨테이너 환경을 자동화하고 운영 부하를 획기적으로 줄인 실제 기업 사례를 소개합니다.
글 읽기 →2026-04-08
팬톤이 Azure Cosmos DB를 기반으로 한 에이전트 AI 아키텍처를 통해 색상 팔레트 생성 워크플로우를 혁신한 실제 사례와 그로부터 얻은 실무 인사이트를 소개합니다.
글 읽기 →
2026-04-07
단일 장애가 전체 시스템을 마비시켰던 모놀리식 아키텍처를, AWS EventBridge를 활용해 초당 2000개 이벤트를 99.99% 성공률로 처리하는 탄력적인 시스템으로 전환한 여정과 핵심 인사이트를 공유합니다.
글 읽기 →
2026-03-26
글로벌 금융기관 산탄데르가 Catalyst 플랫폼을 통해 클라우드 프로비저닝 시간을 90일에서 몇 시간으로 단축하고, AI 에이전트부터 데이터 플랫폼까지 표준화한 실무 인사이트를 공유합니다.
글 읽기 →
2026-03-23
메타가 수년간 유지해온 내부 FFmpeg 포크를 어떻게 업스트림에 기여하며 폐기했는지, 대규모 VOD/라이브스트리밍 파이프라인의 효율화 사례를 소개합니다.
글 읽기 →
2026-03-20
복잡한 조건부 로직이 있는 다단계 폼을 구현할 때, 컴포넌트 중심(RHF+Zod)과 스키마 중심(SurveyJS) 접근법의 실질적 차이와 선택 기준을 비교 분석합니다.
글 읽기 →2026-03-19
Spotify의 실제 사례를 통해 배우는, 대규모 코드베이스에서 머지 가능한 PR을 안정적으로 생성하는 프롬프트 작성법과 도구 설계 인사이트.
글 읽기 →2026-03-18
전 세계 인터넷 사용자가 매일 마주하는 보안 검증 UI를 어떻게 더 명확하고 접근성 높게 만들었는지, 그 디자인 프로세스와 교훈을 공유합니다.
글 읽기 →
2026-03-18
복잡한 금융 API 플랫폼에서 Amazon Verified Permissions와 Cedar 정책 언어를 활용해 고도화된 인가 모델을 구축한 Convera의 아키텍처 인사이트와 실무 적용 팁을 소개합니다.
글 읽기 →
2026-03-18
Netflix가 복잡한 Spinnaker 기반 클라우드 운영을 Temporal의 Durable Execution 플랫폼으로 마이그레이션하며 얻은 극적인 신뢰성 향상과 아키텍처 인사이트를 공유합니다.
글 읽기 →
2026-03-11
Netflix Ranker 서비스의 핫스팟을 해결하며 배운, 알고리즘 개선부터 메모리 레이아웃, SIMD 활용까지의 실전 최적화 여정을 공유합니다.
글 읽기 →
2026-03-05
복잡한 자바스크립트 라이브러리 없이 브라우저 네이티브 Popover API로 견고하고 접근성 좋은 툴팁을 구현하는 인사이트와 실전 팁.
글 읽기 →
2026-03-04
Jira에서 단일 대시보드로의 진화, 데이터 통합의 기술적 도전, 그리고 로봇을 통한 릴리스 자동화까지. 대규모 앱 릴리스 관리의 인사이트를 공유합니다.
글 읽기 →
2026-02-24
단일 AI 모델이 아닌, 협업하는 전문화된 에이전트들로 구성된 시스템이 복잡한 비즈니스 워크플로우를 어떻게 해체하는지에 대한 실무 인사이트입니다.
글 읽기 →
2026-02-17
생산성을 높여주는 AI 코딩 에이전트가 가져올 수 있는 보안 위협과, 이를 효과적으로 차단하는 OS 레벨 샌드박싱 전략을 실무 중심으로 정리했습니다.
글 읽기 →
2026-02-10
ML 기반 개인화 시스템과 실험 플랫폼을 분리해야 하는 기술적, 실무적 이유를 스포티파이의 사례를 통해 깊이 있게 살펴봅니다.
글 읽기 →2026-02-01
LLM이 생성한 다단계 고객 여정의 질을 구조적으로 평가하는 CDP(Continuity, Deepening, Progression) 프레임워크의 개념과 실무 적용 방안을 깊이 있게 살펴봅니다.
글 읽기 →
2026-01-31
정적 모킹에 집착하는 픽셀 퍼펙트 개념이 왜 현대 웹 개발에 해로운지, 그리고 디자인 의도를 구현하는 방법에 대한 깊은 고찰입니다.
글 읽기 →2026-01-24
인간의 감독 없이 수천 개의 코드베이스를 자동으로 변경하는 AI 에이전트를 설계할 때, 신뢰성을 확보하는 방법에 대한 스포티파이의 인사이트를 공유합니다.
글 읽기 →
2026-01-22
Web Directions Dev Summit 2025의 핵심 통찰 브라우저의 진정한 힘을 되찾고, 접근성의 본질을 생각하며, AI 시대의 개발자 역할을 고민하는 기록입니다.
글 읽기 →