학습 본문으로 건너뛰기
VAIRODE
pandas 데이터 처리65번째 작은 수업
오늘은 질문 하나만 해결해요65 / 72

도움 없이 한 번 더 풀어보기

Gold provenance-first pipeline을 완성한다

오늘의 질문

frozen synthetic source에서 raw·clean·reject·report·chart를 4-phase 64-state provenance graph로 연결하고 row/key/null·schema·aggregate를 단계마다 대사한 뒤 clean replay로 같은 evidence를 증명한다. dtype drift·index misalignment·missing/invalid 혼합·many-to-many explosion·chained assignment·chart omission·notebook hidden state 중 하나가 주입돼도 마지막 output만 보고 pipeline을 승인한다.를 방치하면 계산은 끝나도 결과의 의미·재현성·의사결정 안전성을 증명할 수 없습니다.

아직 답을 몰라도 괜찮아요. 아래 작은 예시를 보고 먼저 예상해 보세요.

01 · 혼자 확인해요

연습한 문제를 다시 풀며 혼자 확인하기

지금은 방금 연습한 문제를 다시 보는 시간이에요.아직 “완전히 익혔다”고 기록하지 않아요. 나중에 모양이 다른 문제도 도움 없이 풀면 그때 다시 확인할 수 있어요.

답과 과정 확인
80% 이상
내 말로 설명
80% 이상
막힌 곳 고치기
80% 이상
다른 문제에 써보기
80% 이상
스스로 확인하며 작성 중인 답0 / 4
  1. 01

    먼저 생각하기 · 기초

    DI65 predict · Gold provenance-first pipeline을 완성한다: “dtype drift·index misalignment·missing/invalid 혼합·many-to-many explosion·chained assignment·chart omission·notebook hidden state 중 하나가 주입돼도 마지막 output만 보고 pipeline을 승인한다.” fixture를 실행하기 전에 shape·dtype·index·missing·aggregate 중 이 레슨의 결과 변화를 예측한다.

    상황

    정수 점수 열에 pd.NA가 포함되고, nullable Int64·float64·object 변환에 따라 합계와 검증 결과가 달라집니다.

    문제

    각 dtype과 skipna 정책에서 count·sum·mean·comparison 결과를 예측하고, 결측치 처리 계약을 ordered steps로 작성하세요.

    제공 자료
    • Input fixture: score=[10, pd.NA, 30], 그룹 두 개, nullable Int64 contract
    • 결측치를 0으로 대체하는 것은 관측되지 않음과 실제 0을 합치는 정책 변경입니다.
    • 집계의 skipna 기본값을 암묵적으로 사용하지 말고 기대 count와 함께 기록합니다.
    • nullable boolean 비교 결과의 pd.NA는 False와 같지 않습니다.
    • 판정 경계: 출력이 보기 좋은지만 보지 않고 dtype·missingness·index·join cardinality·lineage·replay evidence를 함께 채점합니다.
    • Privacy: 실제 사용자 데이터·운영 파일·환경변수·credential을 읽지 않고 synthetic DataFrame과 고정된 local fixture만 사용합니다.
    • 공개/비공개 경계: 공개 DTO에는 client-safe 자기검토 설명만 둡니다. executable oracle·hidden expected protocol·private deterministic seed·secret sentinel은 production import graph 밖에 둡니다.
    • 검증 조건: pandas·NumPy·Matplotlib의 exact-version 결과를 추정하지 않습니다. 고정 QA image 증거가 있을 때만 Python 3.14.6·pandas 3.0.5·NumPy 2.5.1·Matplotlib 3.11.1 동작을 주장합니다.
    • 과장 금지: 한 번의 성공 실행, 깨끗한 chart, AI 생성 notebook은 데이터 정확성·lineage 완전성·재실행 동일성·자격 합격을 보증하지 않습니다.

    연습과 같은 문제를 다시 풀어 보는 시간이에요. 힌트 없이 먼저 생각해 보세요. 지금 적은 답은 바로 합격으로 기록되지 않아요.

    움직임과 비교
  2. 02

    내 말로 설명하기 · 익힌 것을 써보기

    DI65 explain · Gold provenance-first pipeline을 완성한다: frozen synthetic source에서 raw·clean·reject·report·chart를 4-phase 64-state provenance graph로 연결하고 row/key/null·schema·aggregate를 단계마다 대사한 뒤 clean replay로 같은 evidence를 증명한다.이 결과 해석과 재현성에 필요한 이유를 데이터 의미·연산 의미·증거 경계로 나눠 설명한다.

    상황

    customer_id가 양쪽에서 중복된 merge가 정상처럼 완료되지만 예상 행 수보다 큰 many-to-many 결과를 만듭니다.

    문제

    조인 전 key cardinality, validate 옵션, 예상 행 수 범위, unmatched 정책을 사용해 폭증 원인과 fail-closed gate를 설명하세요.

    제공 자료
    • Input fixture: orders customer_id=[A,A,B], customers customer_id=[A,A,B], inner merge
    • 성공한 merge 호출은 관계 cardinality가 의도와 같다는 증거가 아닙니다.
    • many_to_one 계약이면 right key uniqueness를 조인 전에 검증합니다.
    • 행 수 변화와 unmatched key count를 함께 reconciliation evidence로 남깁니다.
    • 판정 경계: 출력이 보기 좋은지만 보지 않고 dtype·missingness·index·join cardinality·lineage·replay evidence를 함께 채점합니다.
    • Privacy: 실제 사용자 데이터·운영 파일·환경변수·credential을 읽지 않고 synthetic DataFrame과 고정된 local fixture만 사용합니다.
    • 공개/비공개 경계: 공개 DTO에는 client-safe 자기검토 설명만 둡니다. executable oracle·hidden expected protocol·private deterministic seed·secret sentinel은 production import graph 밖에 둡니다.
    • 검증 조건: pandas·NumPy·Matplotlib의 exact-version 결과를 추정하지 않습니다. 고정 QA image 증거가 있을 때만 Python 3.14.6·pandas 3.0.5·NumPy 2.5.1·Matplotlib 3.11.1 동작을 주장합니다.
    • 과장 금지: 한 번의 성공 실행, 깨끗한 chart, AI 생성 notebook은 데이터 정확성·lineage 완전성·재실행 동일성·자격 합격을 보증하지 않습니다.

    연습과 같은 문제를 다시 풀어 보는 시간이에요. 힌트 없이 먼저 생각해 보세요. 지금 적은 답은 바로 합격으로 기록되지 않아요.

    설명 기준과 비교
  3. 03

    틀린 곳 고치기 · 익힌 것을 써보기

    DI65 debug · Gold provenance-first pipeline을 완성한다: 최소 DataFrame/array fixture로 “dtype drift·index misalignment·missing/invalid 혼합·many-to-many explosion·chained assignment·chart omission·notebook hidden state 중 하나가 주입돼도 마지막 output만 보고 pipeline을 승인한다.”를 재현하고 최초 위반 지점만 수정한다.

    상황

    하나의 notebook에서 chained assignment, object dtype 유입, index 순서 불일치, many-to-many merge가 연속 발생합니다.

    문제

    최종 숫자만 고치지 말고 최초로 계약이 깨지는 줄을 찾고, 최소 재현 fixture와 단계별 수정·회귀 검사를 작성하세요.

    제공 자료
    • Input fixture: 네 결함이 섞인 12줄 pandas pipeline과 단계별 row/dtype/index snapshot
    • 최종 예외나 잘못된 chart는 최초 원인이 아니라 downstream symptom일 수 있습니다.
    • 각 transform 직후 schema·index·row count를 기록해 failure localization을 수행합니다.
    • 수정은 결과값 hard-code가 아니라 계약 위반을 제거하는 최소 변경이어야 합니다.
    • 판정 경계: 출력이 보기 좋은지만 보지 않고 dtype·missingness·index·join cardinality·lineage·replay evidence를 함께 채점합니다.
    • Privacy: 실제 사용자 데이터·운영 파일·환경변수·credential을 읽지 않고 synthetic DataFrame과 고정된 local fixture만 사용합니다.
    • 공개/비공개 경계: 공개 DTO에는 client-safe 자기검토 설명만 둡니다. executable oracle·hidden expected protocol·private deterministic seed·secret sentinel은 production import graph 밖에 둡니다.
    • 검증 조건: pandas·NumPy·Matplotlib의 exact-version 결과를 추정하지 않습니다. 고정 QA image 증거가 있을 때만 Python 3.14.6·pandas 3.0.5·NumPy 2.5.1·Matplotlib 3.11.1 동작을 주장합니다.
    • 과장 금지: 한 번의 성공 실행, 깨끗한 chart, AI 생성 notebook은 데이터 정확성·lineage 완전성·재실행 동일성·자격 합격을 보증하지 않습니다.

    연습과 같은 문제를 다시 풀어 보는 시간이에요. 힌트 없이 먼저 생각해 보세요. 지금 적은 답은 바로 합격으로 기록되지 않아요.

    답과 설명 함께 비교
  4. 04

    새 문제에 써보기 · 새 문제

    DI65 transfer · Gold provenance-first pipeline을 완성한다: 실무 인수인계 전에 CSV·SQLite를 검증된 clean data와 report evidence로 바꾸는 배치에 같은 계약을 이식하고 달라진 grain·privacy·cost·decision owner를 방어한다.

    상황

    AI가 생성한 notebook을 dtype drift·missingness·index misalignment·join cardinality 네 scenario와 네 policy, 네 phase의 64-state evidence loop로 검증합니다.

    문제

    모든 state id, phase evidence, final-only verdict, 공개 가능한 artifact 경계를 설계하고 누락 상태를 fail-closed로 판정하세요.

    제공 자료
    • Input fixture: 4 scenarios × 4 policies × 4 phases, synthetic fixtures only
    • policy는 implicit-notebook·clean-only·schema-guarded·provenance-first 네 수준입니다.
    • 최종 verdict는 PUBLISH_REPLAY phase 전에는 공개하지 않습니다.
    • 모든 state는 scenario:policy:phase로 고유하며 executable oracle은 release-test fixture에만 둡니다.
    • 판정 경계: 출력이 보기 좋은지만 보지 않고 dtype·missingness·index·join cardinality·lineage·replay evidence를 함께 채점합니다.
    • Privacy: 실제 사용자 데이터·운영 파일·환경변수·credential을 읽지 않고 synthetic DataFrame과 고정된 local fixture만 사용합니다.
    • 공개/비공개 경계: 공개 DTO에는 client-safe 자기검토 설명만 둡니다. executable oracle·hidden expected protocol·private deterministic seed·secret sentinel은 production import graph 밖에 둡니다.
    • 검증 조건: pandas·NumPy·Matplotlib의 exact-version 결과를 추정하지 않습니다. 고정 QA image 증거가 있을 때만 Python 3.14.6·pandas 3.0.5·NumPy 2.5.1·Matplotlib 3.11.1 동작을 주장합니다.
    • 과장 금지: 한 번의 성공 실행, 깨끗한 chart, AI 생성 notebook은 데이터 정확성·lineage 완전성·재실행 동일성·자격 합격을 보증하지 않습니다.

    연습과 같은 문제를 다시 풀어 보는 시간이에요. 힌트 없이 먼저 생각해 보세요. 지금 적은 답은 바로 합격으로 기록되지 않아요.

    설명 기준과 비교

4개 답이 남았습니다.

02 · 나중에 한 번 더

모양이 다른 문제에서도 같은 생각을 써봐요

DI65 Gold provenance-first pipeline을 완성한다: frozen synthetic source에서 raw·clean·reject·report·chart를 4-phase 64-state provenance graph로 연결하고 row/key/null·schema·aggregate를 단계마다 대사한 뒤 clean replay로 같은 evidence를 증명한다.의 미공개 local drift variant에서 AI 없이 schema·row/key/null invariant·reject ledger·lineage·semantic chart receipt를 만들고 clean replay한다.

검증 과제

AI가 제안한 Gold provenance-first pipeline을 완성한다 구현에 dtype drift, index misalignment, missing-value confusion, chained assignment, cardinality explosion, future/label leakage, privacy over-collection 중 하나 이상을 주입해 deterministic contract test로 찾아 수정한다.