frozen synthetic source에서 raw·clean·reject·report·chart를 4-phase 64-state provenance graph로 연결하고 row/key/null·schema·aggregate를 단계마다 대사한 뒤 clean replay로 같은 evidence를 증명한다. dtype drift·index misalignment·missing/invalid 혼합·many-to-many explosion·chained assignment·chart omission·notebook hidden state 중 하나가 주입돼도 마지막 output만 보고 pipeline을 승인한다.를 방치하면 계산은 끝나도 결과의 의미·재현성·의사결정 안전성을 증명할 수 없습니다.
아직 답을 몰라도 괜찮아요. 아래 작은 예시를 보고 먼저 예상해 보세요.
01 · 같이 연습해요
작은 문제부터 하나씩 직접 풀어봐요
먼저 예상하고, 한 단계씩 확인하고, 막힌 곳을 고쳐 봐요. 도움을 열어도 괜찮아요. 도움을 본 문제는 나중에 모양을 바꿔 다시 풀어보면 됩니다.
연습에서 작성 중인 답0 / 8
01
찾아보기 · 기초
DI65 recognize · Gold provenance-first pipeline을 완성한다: provenance-first pipeline와 64-state 표식에서 “frozen synthetic source에서 raw·clean·reject·report·chart를 4-phase 64-state provenance graph로 연결하고 row/key/null·schema·aggregate를 단계마다 대사한 뒤 clean replay로 같은 evidence를 증명한다.”을 만족하는 dataset 상태를 판별한다.
상황
같은 값이 보이는 두 테이블 중 하나만 nullable dtype·고유 index·schema fingerprint·source lineage를 보존합니다.
문제
화면에 보이는 값과 재현 가능한 데이터 계약 증거를 구분하고, 각 artifact가 답할 수 있는 질문을 표로 작성하세요.
제공 자료
Input fixture: orders_preview와 orders_contract: 값은 같지만 dtype/index/schema/lineage metadata가 다름
문자열처럼 보이는 숫자 열은 화면만으로 Int64인지 object인지 판정할 수 없습니다.
RangeIndex가 우연히 맞는 것과 business key uniqueness가 검증된 것은 다릅니다.
lineage는 원본 위치가 아니라 source id·transform id·contract version의 연결로 기록합니다.
판정 경계: 출력이 보기 좋은지만 보지 않고 dtype·missingness·index·join cardinality·lineage·replay evidence를 함께 채점합니다.
Privacy: 실제 사용자 데이터·운영 파일·환경변수·credential을 읽지 않고 synthetic DataFrame과 고정된 local fixture만 사용합니다.
공개/비공개 경계: 공개 DTO에는 client-safe 자기검토 설명만 둡니다. executable oracle·hidden expected protocol·private deterministic seed·secret sentinel은 production import graph 밖에 둡니다.
검증 조건: pandas·NumPy·Matplotlib의 exact-version 결과를 추정하지 않습니다. 고정 QA image 증거가 있을 때만 Python 3.14.6·pandas 3.0.5·NumPy 2.5.1·Matplotlib 3.11.1 동작을 주장합니다.
과장 금지: 한 번의 성공 실행, 깨끗한 chart, AI 생성 notebook은 데이터 정확성·lineage 완전성·재실행 동일성·자격 합격을 보증하지 않습니다.
정답 대신 4단계 힌트 보기
관찰
DI65에서는 출력 셀만 보지 말고 shape, columns, index, dtypes, null count, unique key와 aggregate를 전후로 적으세요.
개념
frozen synthetic source에서 raw·clean·reject·report·chart를 4-phase 64-state provenance graph로 연결하고 row/key/null·schema·aggregate를 단계마다 대사한 뒤 clean replay로 같은 evidence를 증명한다.
다음 도움
내 생각을 먼저 적고 ‘내 답과 맞춰 볼 기준 보기’을 누르면, 풀 순서와 더 자세한 도움을 열어 드려요.
정답과 비교
02
먼저 생각하기 · 기초
DI65 predict · Gold provenance-first pipeline을 완성한다: “dtype drift·index misalignment·missing/invalid 혼합·many-to-many explosion·chained assignment·chart omission·notebook hidden state 중 하나가 주입돼도 마지막 output만 보고 pipeline을 승인한다.” fixture를 실행하기 전에 shape·dtype·index·missing·aggregate 중 이 레슨의 결과 변화를 예측한다.
상황
정수 점수 열에 pd.NA가 포함되고, nullable Int64·float64·object 변환에 따라 합계와 검증 결과가 달라집니다.
문제
각 dtype과 skipna 정책에서 count·sum·mean·comparison 결과를 예측하고, 결측치 처리 계약을 ordered steps로 작성하세요.
제공 자료
Input fixture: score=[10, pd.NA, 30], 그룹 두 개, nullable Int64 contract
결측치를 0으로 대체하는 것은 관측되지 않음과 실제 0을 합치는 정책 변경입니다.
집계의 skipna 기본값을 암묵적으로 사용하지 말고 기대 count와 함께 기록합니다.
nullable boolean 비교 결과의 pd.NA는 False와 같지 않습니다.
판정 경계: 출력이 보기 좋은지만 보지 않고 dtype·missingness·index·join cardinality·lineage·replay evidence를 함께 채점합니다.
Privacy: 실제 사용자 데이터·운영 파일·환경변수·credential을 읽지 않고 synthetic DataFrame과 고정된 local fixture만 사용합니다.
공개/비공개 경계: 공개 DTO에는 client-safe 자기검토 설명만 둡니다. executable oracle·hidden expected protocol·private deterministic seed·secret sentinel은 production import graph 밖에 둡니다.
검증 조건: pandas·NumPy·Matplotlib의 exact-version 결과를 추정하지 않습니다. 고정 QA image 증거가 있을 때만 Python 3.14.6·pandas 3.0.5·NumPy 2.5.1·Matplotlib 3.11.1 동작을 주장합니다.
과장 금지: 한 번의 성공 실행, 깨끗한 chart, AI 생성 notebook은 데이터 정확성·lineage 완전성·재실행 동일성·자격 합격을 보증하지 않습니다.
정답 대신 4단계 힌트 보기
관찰
DI65에서는 출력 셀만 보지 말고 shape, columns, index, dtypes, null count, unique key와 aggregate를 전후로 적으세요.
개념
frozen synthetic source에서 raw·clean·reject·report·chart를 4-phase 64-state provenance graph로 연결하고 row/key/null·schema·aggregate를 단계마다 대사한 뒤 clean replay로 같은 evidence를 증명한다.
다음 도움
내 생각을 먼저 적고 ‘내 답과 맞춰 볼 기준 보기’을 누르면, 풀 순서와 더 자세한 도움을 열어 드려요.
판정 경계: 출력이 보기 좋은지만 보지 않고 dtype·missingness·index·join cardinality·lineage·replay evidence를 함께 채점합니다.
Privacy: 실제 사용자 데이터·운영 파일·환경변수·credential을 읽지 않고 synthetic DataFrame과 고정된 local fixture만 사용합니다.
공개/비공개 경계: 공개 DTO에는 client-safe 자기검토 설명만 둡니다. executable oracle·hidden expected protocol·private deterministic seed·secret sentinel은 production import graph 밖에 둡니다.
검증 조건: pandas·NumPy·Matplotlib의 exact-version 결과를 추정하지 않습니다. 고정 QA image 증거가 있을 때만 Python 3.14.6·pandas 3.0.5·NumPy 2.5.1·Matplotlib 3.11.1 동작을 주장합니다.
과장 금지: 한 번의 성공 실행, 깨끗한 chart, AI 생성 notebook은 데이터 정확성·lineage 완전성·재실행 동일성·자격 합격을 보증하지 않습니다.
정답 대신 4단계 힌트 보기
관찰
DI65에서는 출력 셀만 보지 말고 shape, columns, index, dtypes, null count, unique key와 aggregate를 전후로 적으세요.
개념
frozen synthetic source에서 raw·clean·reject·report·chart를 4-phase 64-state provenance graph로 연결하고 row/key/null·schema·aggregate를 단계마다 대사한 뒤 clean replay로 같은 evidence를 증명한다.
다음 도움
내 생각을 먼저 적고 ‘내 답과 맞춰 볼 기준 보기’을 누르면, 풀 순서와 더 자세한 도움을 열어 드려요.
움직임과 비교
04
내 말로 설명하기 · 익힌 것을 써보기
DI65 explain · Gold provenance-first pipeline을 완성한다: frozen synthetic source에서 raw·clean·reject·report·chart를 4-phase 64-state provenance graph로 연결하고 row/key/null·schema·aggregate를 단계마다 대사한 뒤 clean replay로 같은 evidence를 증명한다.이 결과 해석과 재현성에 필요한 이유를 데이터 의미·연산 의미·증거 경계로 나눠 설명한다.
상황
customer_id가 양쪽에서 중복된 merge가 정상처럼 완료되지만 예상 행 수보다 큰 many-to-many 결과를 만듭니다.
문제
조인 전 key cardinality, validate 옵션, 예상 행 수 범위, unmatched 정책을 사용해 폭증 원인과 fail-closed gate를 설명하세요.
판정 경계: 출력이 보기 좋은지만 보지 않고 dtype·missingness·index·join cardinality·lineage·replay evidence를 함께 채점합니다.
Privacy: 실제 사용자 데이터·운영 파일·환경변수·credential을 읽지 않고 synthetic DataFrame과 고정된 local fixture만 사용합니다.
공개/비공개 경계: 공개 DTO에는 client-safe 자기검토 설명만 둡니다. executable oracle·hidden expected protocol·private deterministic seed·secret sentinel은 production import graph 밖에 둡니다.
검증 조건: pandas·NumPy·Matplotlib의 exact-version 결과를 추정하지 않습니다. 고정 QA image 증거가 있을 때만 Python 3.14.6·pandas 3.0.5·NumPy 2.5.1·Matplotlib 3.11.1 동작을 주장합니다.
과장 금지: 한 번의 성공 실행, 깨끗한 chart, AI 생성 notebook은 데이터 정확성·lineage 완전성·재실행 동일성·자격 합격을 보증하지 않습니다.
정답 대신 4단계 힌트 보기
관찰
DI65에서는 출력 셀만 보지 말고 shape, columns, index, dtypes, null count, unique key와 aggregate를 전후로 적으세요.
개념
frozen synthetic source에서 raw·clean·reject·report·chart를 4-phase 64-state provenance graph로 연결하고 row/key/null·schema·aggregate를 단계마다 대사한 뒤 clean replay로 같은 evidence를 증명한다.
다음 도움
내 생각을 먼저 적고 ‘내 답과 맞춰 볼 기준 보기’을 누르면, 풀 순서와 더 자세한 도움을 열어 드려요.
답과 설명 함께 비교
06
틀린 곳 고치기 · 익힌 것을 써보기
DI65 debug · Gold provenance-first pipeline을 완성한다: 최소 DataFrame/array fixture로 “dtype drift·index misalignment·missing/invalid 혼합·many-to-many explosion·chained assignment·chart omission·notebook hidden state 중 하나가 주입돼도 마지막 output만 보고 pipeline을 승인한다.”를 재현하고 최초 위반 지점만 수정한다.
상황
하나의 notebook에서 chained assignment, object dtype 유입, index 순서 불일치, many-to-many merge가 연속 발생합니다.
문제
최종 숫자만 고치지 말고 최초로 계약이 깨지는 줄을 찾고, 최소 재현 fixture와 단계별 수정·회귀 검사를 작성하세요.
제공 자료
Input fixture: 네 결함이 섞인 12줄 pandas pipeline과 단계별 row/dtype/index snapshot
최종 예외나 잘못된 chart는 최초 원인이 아니라 downstream symptom일 수 있습니다.
각 transform 직후 schema·index·row count를 기록해 failure localization을 수행합니다.
수정은 결과값 hard-code가 아니라 계약 위반을 제거하는 최소 변경이어야 합니다.
판정 경계: 출력이 보기 좋은지만 보지 않고 dtype·missingness·index·join cardinality·lineage·replay evidence를 함께 채점합니다.
Privacy: 실제 사용자 데이터·운영 파일·환경변수·credential을 읽지 않고 synthetic DataFrame과 고정된 local fixture만 사용합니다.
공개/비공개 경계: 공개 DTO에는 client-safe 자기검토 설명만 둡니다. executable oracle·hidden expected protocol·private deterministic seed·secret sentinel은 production import graph 밖에 둡니다.
검증 조건: pandas·NumPy·Matplotlib의 exact-version 결과를 추정하지 않습니다. 고정 QA image 증거가 있을 때만 Python 3.14.6·pandas 3.0.5·NumPy 2.5.1·Matplotlib 3.11.1 동작을 주장합니다.
과장 금지: 한 번의 성공 실행, 깨끗한 chart, AI 생성 notebook은 데이터 정확성·lineage 완전성·재실행 동일성·자격 합격을 보증하지 않습니다.
정답 대신 4단계 힌트 보기
관찰
DI65에서는 출력 셀만 보지 말고 shape, columns, index, dtypes, null count, unique key와 aggregate를 전후로 적으세요.
개념
frozen synthetic source에서 raw·clean·reject·report·chart를 4-phase 64-state provenance graph로 연결하고 row/key/null·schema·aggregate를 단계마다 대사한 뒤 clean replay로 같은 evidence를 증명한다.
다음 도움
내 생각을 먼저 적고 ‘내 답과 맞춰 볼 기준 보기’을 누르면, 풀 순서와 더 자세한 도움을 열어 드려요.
답과 설명 함께 비교
07
직접 만들기 · 새 문제
DI65 implement · Gold provenance-first pipeline을 완성한다: PROFILE_CONTRACT→TRANSFORM_WITH_LINEAGE→VALIDATE_RECONCILE→PUBLISH_REPLAY를 통과하는 provenance-first data pipeline lab을 구현한다.을 synthetic input·고정 seed·명시 schema로 구현하고 source/config fingerprint·64-state lineage·schema/profile snapshots·reject ledger·row/key/null 및 aggregate reconciliation·SVG/PNG·clean-replay manifest를 생성한다.
상황
고정 synthetic sales DataFrame을 정제·집계하고, expected frame 검증과 의미가 고정된 Matplotlib chart evidence를 함께 만들어야 합니다.
문제
pandas 변환 함수, assert_frame_equal 기반 oracle, 비대화식 Matplotlib chart, semantic manifest를 구현하세요.
판정 경계: 출력이 보기 좋은지만 보지 않고 dtype·missingness·index·join cardinality·lineage·replay evidence를 함께 채점합니다.
Privacy: 실제 사용자 데이터·운영 파일·환경변수·credential을 읽지 않고 synthetic DataFrame과 고정된 local fixture만 사용합니다.
공개/비공개 경계: 공개 DTO에는 client-safe 자기검토 설명만 둡니다. executable oracle·hidden expected protocol·private deterministic seed·secret sentinel은 production import graph 밖에 둡니다.
검증 조건: pandas·NumPy·Matplotlib의 exact-version 결과를 추정하지 않습니다. 고정 QA image 증거가 있을 때만 Python 3.14.6·pandas 3.0.5·NumPy 2.5.1·Matplotlib 3.11.1 동작을 주장합니다.
과장 금지: 한 번의 성공 실행, 깨끗한 chart, AI 생성 notebook은 데이터 정확성·lineage 완전성·재실행 동일성·자격 합격을 보증하지 않습니다.
정답 대신 4단계 힌트 보기
관찰
DI65에서는 출력 셀만 보지 말고 shape, columns, index, dtypes, null count, unique key와 aggregate를 전후로 적으세요.
개념
frozen synthetic source에서 raw·clean·reject·report·chart를 4-phase 64-state provenance graph로 연결하고 row/key/null·schema·aggregate를 단계마다 대사한 뒤 clean replay로 같은 evidence를 증명한다.
다음 도움
내 생각을 먼저 적고 ‘내 답과 맞춰 볼 기준 보기’을 누르면, 풀 순서와 더 자세한 도움을 열어 드려요.
정답과 비교
08
새 문제에 써보기 · 새 문제
DI65 transfer · Gold provenance-first pipeline을 완성한다: 실무 인수인계 전에 CSV·SQLite를 검증된 clean data와 report evidence로 바꾸는 배치에 같은 계약을 이식하고 달라진 grain·privacy·cost·decision owner를 방어한다.
상황
AI가 생성한 notebook을 dtype drift·missingness·index misalignment·join cardinality 네 scenario와 네 policy, 네 phase의 64-state evidence loop로 검증합니다.
문제
모든 state id, phase evidence, final-only verdict, 공개 가능한 artifact 경계를 설계하고 누락 상태를 fail-closed로 판정하세요.
policy는 implicit-notebook·clean-only·schema-guarded·provenance-first 네 수준입니다.
최종 verdict는 PUBLISH_REPLAY phase 전에는 공개하지 않습니다.
모든 state는 scenario:policy:phase로 고유하며 executable oracle은 release-test fixture에만 둡니다.
판정 경계: 출력이 보기 좋은지만 보지 않고 dtype·missingness·index·join cardinality·lineage·replay evidence를 함께 채점합니다.
Privacy: 실제 사용자 데이터·운영 파일·환경변수·credential을 읽지 않고 synthetic DataFrame과 고정된 local fixture만 사용합니다.
공개/비공개 경계: 공개 DTO에는 client-safe 자기검토 설명만 둡니다. executable oracle·hidden expected protocol·private deterministic seed·secret sentinel은 production import graph 밖에 둡니다.
검증 조건: pandas·NumPy·Matplotlib의 exact-version 결과를 추정하지 않습니다. 고정 QA image 증거가 있을 때만 Python 3.14.6·pandas 3.0.5·NumPy 2.5.1·Matplotlib 3.11.1 동작을 주장합니다.
과장 금지: 한 번의 성공 실행, 깨끗한 chart, AI 생성 notebook은 데이터 정확성·lineage 완전성·재실행 동일성·자격 합격을 보증하지 않습니다.
정답 대신 4단계 힌트 보기
관찰
DI65에서는 출력 셀만 보지 말고 shape, columns, index, dtypes, null count, unique key와 aggregate를 전후로 적으세요.
개념
frozen synthetic source에서 raw·clean·reject·report·chart를 4-phase 64-state provenance graph로 연결하고 row/key/null·schema·aggregate를 단계마다 대사한 뒤 clean replay로 같은 evidence를 증명한다.
다음 도움
내 생각을 먼저 적고 ‘내 답과 맞춰 볼 기준 보기’을 누르면, 풀 순서와 더 자세한 도움을 열어 드려요.
설명 기준과 비교
8개 답이 남았습니다.
02 · 막힌 곳을 찾아요
틀린 답에서 생각이 갈라진 첫 지점 찾기
헷갈림 01
dtype drift·index misalignment·missing/invalid 혼합·many-to-many explosion·chained assignment·chart omission·notebook hidden state 중 하나가 주입돼도 마지막 output만 보고 pipeline을 승인한다.
겉으로 보이는 막힘
Gold provenance-first pipeline을 완성한다의 output은 생성되지만 행·열·dtype·key 또는 해석 가능한 분모가 입력 계약과 어긋난다.
막힌 까닭
frozen synthetic source에서 raw·clean·reject·report·chart를 4-phase 64-state provenance graph로 연결하고 row/key/null·schema·aggregate를 단계마다 대사한 뒤 clean replay로 같은 evidence를 증명한다.을 transform 전후 assertion으로 고정하지 않았다.
다시 해보는 방법
PROFILE_CONTRACT→TRANSFORM_WITH_LINEAGE→VALIDATE_RECONCILE→PUBLISH_REPLAY를 통과하는 provenance-first data pipeline lab을 구현한다.에 pre/post guard와 reject ledger를 추가하고 최소 fixture를 다시 실행한다.
헷갈림 02
Gold provenance-first pipeline을 완성한다 pipeline 중간 결과를 notebook memory에 남긴 채 셀을 순서 밖으로 재실행한다.
겉으로 보이는 막힘
같은 입력과 코드처럼 보여도 hidden state 때문에 결과·row count·dtype가 달라진다.
막힌 까닭
단계별 입력·출력 owner와 idempotent 경계 및 clean restart 검증이 없다.
다시 해보는 방법
raw snapshot에서 모든 단계를 순서대로 재실행하고 ${seed.evidence}를 새 실행 ID로 대조한다.
헷갈림 03
source/config fingerprint·64-state lineage·schema/profile snapshots·reject ledger·row/key/null 및 aggregate reconciliation·SVG/PNG·clean-replay manifest를 만들며 원본 식별자·민감 열·AI prompt에 private row를 그대로 포함한다.
겉으로 보이는 막힘
학습 artifact가 재식별 가능하거나 공유 불가능해지고 결과 검증과 개인정보 보호가 충돌한다.
막힌 까닭
수집 전 최소화·synthetic fixture·column allowlist·집계 공개 경계를 두지 않았다.
다시 해보는 방법
민감 열을 source 경계에서 제거하거나 합성하고 privacy negative control 뒤 증거를 다시 만든다.
Gold provenance-first pipeline을 완성한다의 입력 grain과 schema, 변환 단계, 오류 분기, 검증 증거를 번호·도형·선 종류로 구분한 도식에서 색상 외에도 raw·clean·reject·report, schema·row·key·null·lineage·verdict label과 선 종류를 함께 표시한다.혼자 해보기
내 힘으로
DI65 Gold provenance-first pipeline을 완성한다: frozen synthetic source에서 raw·clean·reject·report·chart를 4-phase 64-state provenance graph로 연결하고 row/key/null·schema·aggregate를 단계마다 대사한 뒤 clean replay로 같은 evidence를 증명한다.의 처음 보는 synthetic fixture를 먼저 판정한 뒤 Python 3.14.6·pandas 3.0.5·NumPy 2.5.1·Matplotlib 3.11.1 local harness에서 replay하고 불일치만 공식 계약으로 교정한다.
공식 문서·문법·library API는 열 수 있지만 해당 변형의 exact row/key/null count·schema diff·join cardinality·reject reason·hidden grader 판정은 먼저 제공하지 않는다.더 도전하기
심화형
실무 인수인계 전에 CSV·SQLite를 검증된 clean data와 report evidence로 바꾸는 배치의 volume·null pattern·category drift·privacy 축 하나를 추가하고 같은 계약을 clean restart로 검증한다.
Gold provenance-first pipeline을 완성한다에서 편의보다 의미 보존·reproducibility·privacy·실패 가시성을 우선하고 제거·대체·격리 비용을 기록한다.