Smart Infrastructure LabYONSEI UNIVERSITY
← 블로그

대학원생을 위한 연구와 논문 4: 좋은 실험은 어떻게 설계하는가?

공정한 비교, 자료 분리, 지표, 반복 실험을 연구 주장에 맞춰 설계하는 방법을 살펴봅니다.

대학원생을 위한 연구와 논문 · 4편

좋은 결과표보다 먼저 필요한 것

연구 질문과 가설을 세웠다면 다음에는 실험을 설계해야 합니다. 이때 학생들이 자주 묻는 질문이 있습니다.

“비교 모델을 몇 개 넣으면 될까요?”

“Ablation은 어떤 것을 하면 될까요?”

중요한 질문입니다. 다만 먼저 물어야 할 것이 있습니다.

이 실험 결과로 무엇을 주장하려는가?

예를 들어 IoU가 0.70에서 0.72로 높아졌다면 차이는 0.02, 백분율로 표현할 때 2퍼센트포인트입니다. 그 결과가 성능 개선을 뒷받침하는지, 개선 원인까지 설명하는지, 새로운 현장에서도 유효한지는 서로 다른 문제입니다. 필요한 실험도 달라집니다.

이 글의 수치, 건설 문서 AI, 균열 분할 사례는 모두 가상 예시입니다. 인용 문헌의 실제 실험 결과로 읽어서는 안 됩니다.

주장에 맞추어 증거를 설계하기

하려는 주장 필요한 비교나 평가의 예
기존 방법보다 성능이 좋다 관련성 있는 강한 비교 방법, 합리적인 튜닝, 같은 평가 조건
제안한 설계 요소가 개선에 기여한다 해당 요소의 효과와 다른 변화의 영향을 구분하는 비교
새로운 현장에서도 잘 작동한다 학습에 포함되지 않은 현장을 대상으로 한 평가
실무적으로 유용하다 실제 업무와 관련된 오류, 시간, 비용, 사용 조건의 평가

이 표는 모든 연구가 네 주장을 모두 해야 한다는 뜻이 아닙니다. 이번 논문이 하려는 주장에 필요한 실험을 선택하라는 뜻입니다. 실험의 수가 많아도 핵심 주장을 확인하지 못하면 충분한 설계라고 하기 어렵습니다.

예시 1: 조항 관계를 명시하면 RAG의 판단이 좋아지는가?

연구 질문이 다음과 같다고 합시다.

같은 근거를 제공할 때, 조항 사이의 조건·예외 관계를 명시하면 LLM의 판단 정확도가 높아지는가?

새 방법에서 모델을 바꾸고, 검색기를 개선하고, 제공하는 정보까지 늘렸다면 전체 시스템을 비교할 수는 있습니다. 그러나 그 결과만으로 관계 표현 방식의 효과를 분리하기는 어렵습니다.

이 질문에는 같은 모델과 질문 집합, 같은 실질적 근거를 사용하면서 표현 방식을 비교하는 설계가 적절할 수 있습니다. 표현에 정답을 암시하는 추가 사실이 들어갔는지, 길이·순서 같은 변화가 다른 설명이 될 수 있는지도 살펴야 합니다. 모든 문자열을 동일하게 만들라는 뜻은 아닙니다. 관심 있는 차이와 그 밖의 차이를 구분하라는 뜻입니다.

필요한 근거를 직접 제공하는 oracle evidence 실험과 검색부터 수행하는 end-to-end 실험도 구분해야 합니다. 전자는 근거가 주어진 조건에서의 해석을, 후자는 검색 실패까지 포함한 시스템의 성능을 평가합니다. 두 결과를 함께 보면 어디에서 문제가 나타나는지 이해하는 데 도움이 됩니다.

정답률뿐 아니라 조건·예외의 해석, 근거의 적절성, 답변할 수 없는 질문에 대한 대응 등도 연구 주장에 맞게 평가할 수 있습니다. 평가 기준은 결과를 보기 전에 구체화하고, 여러 사람이 판정한다면 판정 절차와 불일치 처리 방법도 설명하세요.

공정한 비교가 모든 설정을 같게 한다는 뜻은 아니다

Baseline은 연구 질문에 따라 고릅니다. 간단하지만 의미 있는 방법, 해당 문제에서 경쟁력 있는 방법, 제안 요소를 검토하기 위한 대조 방법이 서로 다른 역할을 할 수 있습니다. 유명한 모델을 많이 넣는 것만으로 충분해지는 것은 아닙니다.

공정한 비교를 위해 모든 모델에 같은 learning rate나 epoch 수를 강제로 적용해야 하는 것도 아닙니다. 모델별로 적절한 학습 조건이 다를 수 있습니다. 자료 분리와 평가 기준을 일관되게 두고, 각 방법에 합리적인 튜닝 기회를 주며 탐색 범위와 계산 자원을 보고하는 것이 중요합니다.

효율성이 주장이라면 시간·메모리·계산량을 함께 평가해야 합니다. 특정 설계의 효과가 주장이라면 모델 용량이나 학습량을 고려한 대조가 더 중요할 수 있습니다. 무엇을 맞출지는 비교의 목적에 따라 정합니다.

예시 2: 얇은 균열을 덜 놓친다는 것을 어떻게 보일까?

가설이 “고해상도 특징 보존이 얇은 균열의 누락을 줄인다”라면 전체 IoU만 제시하는 것으로 충분하지 않을 수 있습니다.

먼저 ‘얇다’의 정의가 필요합니다. 원본 영상에서 몇 픽셀 이하라는 의미인지, 실제 균열 폭을 의미하는지 구분하세요. 해상도와 촬영 거리, resizing 방식에 따라 픽셀 폭이 달라질 수 있습니다.

그다음 주장을 직접 확인할 지표를 고릅니다. 얇은 균열의 누락이나 재현율, 오검출, 연결성, 길이 오차 등이 후보입니다. 전부 사용할 필요는 없지만 어떤 현상을 측정하는지 설명할 수 있어야 합니다. 연결성을 평가한다면 정답 마스크와 전처리에서 연결 구조가 어떻게 정의되고 보존되는지도 중요합니다.

Reinke 등(2024)은 영상 분석 검증에서 지표의 선택과 사용에 생기는 문제를 정리합니다. 주된 맥락은 생의학 영상 분석이며, 여기서는 연구 목적에 맞는 지표를 선택한다는 원칙을 공학 사례에 적용한 것입니다.[1] 이 논문이 위 균열 가설을 검증한 것은 아닙니다.

평균을 내는 단위도 명시해야 합니다. 모든 픽셀을 합쳐 계산한 IoU와 이미지별 IoU의 평균은 다른 값이 될 수 있습니다. 어떤 영상이나 현장이 결과에 더 큰 비중을 갖는지까지 생각해야 합니다.

Ablation이 알려주는 것과 남겨두는 것

모듈 A를 제거했을 때 성능이 낮아졌다면, 평가한 조건에서 A를 포함하는 설계가 효과적이었다는 근거가 됩니다. 다만 제거와 함께 모델 용량, 특징 해상도, 학습 안정성 등이 바뀌었을 수 있습니다. 성능 차이 하나로 논문에서 제안한 작동 원리가 확정되지는 않습니다.

필요하다면 유사한 용량의 대조 모델을 두거나, 다른 방식으로 해상도를 유지하거나, 주장한 중간 현상을 직접 관찰할 수 있습니다. A와 B의 상호작용이 핵심이라면 둘 다 없음·A만 있음·B만 있음·둘 다 있음의 비교가 도움이 됩니다. 모든 연구에 모든 조합의 실험이 의무인 것은 아닙니다.

2,000개 패치가 2,000개 독립 표본은 아니다

원본 사진 100장에서 각각 20개의 crop을 만들면 파일은 2,000개입니다. 그러나 같은 사진에서 나온 패치는 서로 관련되어 있으므로, 자동으로 2,000개의 독립 표본이 되는 것은 아닙니다. 100장의 사진도 같은 현장이나 구조물에서 촬영되었다면 서로 의존할 수 있습니다.

Hurlbert(1984)는 생태학의 현장실험에서 독립적인 반복과 그렇지 않은 관측을 혼동하는 pseudoreplication 문제를 다룬 고전적인 논문입니다.[2] 이를 딥러닝의 패치 수에 직접 관한 연구로 소개해서는 안 됩니다. 여기서는 관측 파일 수와 추론에 필요한 독립 단위가 다를 수 있다는 점을 생각하는 데 참고합니다.

자료 분리의 단위는 평가하려는 상황에 맞춰 정해야 합니다.

Roberts 등(2017)은 시간·공간·계층 등의 구조를 가진 자료에서 교차검증 전략을 다룹니다. 분리 방식은 예측 목표에 맞아야 하며, 무조건 더 큰 단위로 묶는 것이 언제나 정답은 아닙니다. 블록 분리가 외삽을 요구하는 다른 과제로 바뀔 수도 있습니다.[3]

학습과 시험 자료가 서로 가까워 평가가 낙관적으로 되는 문제와, 시험 관측치끼리 의존하여 불확실성을 잘못 계산하는 문제는 구분해야 합니다. 자료를 나누는 일과 신뢰구간 등을 계산하는 일에 모두 의존 구조가 영향을 줄 수 있습니다.

시험 자료를 얼마나 오래 ‘보지 않은 자료’로 유지했는가?

시험 결과를 보고 계속 모델이나 프롬프트를 고르면 그 자료는 사실상 개발에 사용된 것입니다. Cawley와 Talbot(2010)은 모델 선택 과정 자체의 과적합과 평가 편향을 분석합니다.[4]

학습·개발·최종 평가 자료를 구분하거나 연구 조건에 맞는 교차검증 절차를 사용하고, 최종 평가가 어떤 의사결정에 사용되었는지 명시하세요. 모든 연구에 하나의 분할 비율을 적용할 필요는 없습니다.

RAG에서는 평가 대상 문서가 검색 색인에 들어 있다는 사실만으로 누출이라고 단정할 수 없습니다. 실제 사용 시 그 문서를 검색할 수 있다는 조건이라면 필요한 설정일 수 있습니다. 정답 라벨이나 비공개 평가 해설을 넣는 것, 시험 결과를 보고 시스템을 선택하는 것은 별도로 검토해야 합니다.

반복 실험은 어떤 변동을 확인하는가?

한 번의 실행 결과만으로는 성능의 안정성을 알기 어렵습니다. Bouthillier 등(2021)은 기계학습 벤치마크에서 자료 표집, 초기화, 하이퍼파라미터 등 여러 변동 요인을 고려할 필요를 다룹니다.[5]

Random seed를 바꾸어 반복하면 해당 실행 조건에서의 변동을 살필 수 있습니다. 그것만으로 새로운 현장의 일반화 성능이나 표본 추출의 불확실성까지 확인한 것은 아닙니다. 어떤 변동을 측정했는지 밝히고, 반복 수는 연구 목적과 변동 규모, 자원에 맞게 정하세요. 모든 연구에 통하는 보편적인 횟수는 없습니다.

성능 차이의 크기와 불확실성, 실제로 중요한 차이인지를 함께 보고하는 것이 좋습니다. 여러 seed를 같은 시험 자료에서 평가했다면 그 결과를 전부 독립적인 새 시험 표본으로 취급해서도 안 됩니다.

실험을 시작하기 전에 써볼 다섯 문장

  1. 이 실험으로 확인하려는 주장은 ___이다.
  2. 이를 위해 비교해야 하는 조건은 ___이다.
  3. 자료의 분리와 독립 단위는 ___이며, 평가 대상은 ___이다.
  4. 주장을 확인할 지표와 판단 기준은 ___이다.
  5. 같은 결과를 만들 수 있는 다른 설명은 ___이며, 이를 ___로 검토한다.

모델 설정, 자료 분리, 전처리, 평가 절차를 기록하면 다른 사람이 결과를 이해하고 재현하는 데 도움이 됩니다. 결과표를 먼저 채우기보다, 그 표가 뒷받침할 수 있는 문장을 먼저 써보세요. 좋은 실험 설계는 질문과 결론 사이에 필요한 증거를 놓는 과정입니다.

참고문헌과 읽기 안내

  1. Reinke, A., Tizabi, M. D., Baumgartner, M., et al. (2024). Understanding metric-related pitfalls in image analysis validation. Nature Methods, 21(2), 182–194. DOI
  2. Hurlbert, S. H. (1984). Pseudoreplication and the design of ecological field experiments. Ecological Monographs, 54(2), 187–211. DOI
  3. Roberts, D. R., Bahn, V., Ciuti, S., et al. (2017). Cross-validation strategies for data with temporal, spatial, hierarchical, or phylogenetic structure. Ecography, 40(8), 913–929. DOI
  4. Cawley, G. C., & Talbot, N. L. C. (2010). On over-fitting in model selection and subsequent selection bias in performance evaluation. Journal of Machine Learning Research, 11, 2079–2107. 원문
  5. Bouthillier, X., Delaunay, P., Bronzi, M., et al. (2021). Accounting for variance in machine learning benchmarks. Proceedings of Machine Learning and Systems, 3. 학회 공식 논문 페이지

Roberts 등의 논문은 온라인 공개가 2016년, 권·호에 따른 출판 연도가 2017년입니다. Reinke 등의 DOI에 2023이 들어 있지만, 위 서지는 2024년 정식 출판본을 기준으로 합니다. 저자가 많은 문헌은 읽기 편의를 위해 저자 목록을 줄여 표기했습니다.

그림으로 정리하기

실험 설계의 다섯 요소, RAG와 균열 인식의 비교 설계, 자료 독립성과 해석 범위

그림을 누르면 확대해 볼 수 있습니다.


Read this article in English

대학원생을 위한 연구와 논문 시리즈

  1. 연구란 무엇인가?
  2. Research Gap은 어떻게 찾는가?
  3. Research Question과 연구 가설은 어떻게 세우는가?
  4. 좋은 실험은 어떻게 설계하는가?
← 글 목록다음 글 →대학원생을 위한 연구와 논문 3: Research Question과 연구 가설은 어떻게 세우는가?