Methods · Calibration · Accountability

좋은 질문이 믿을 만한 결론이 되기까지의 과정을 공개합니다.

문헌을 많이 찾는 것만으로는 충분하지 않습니다. 원문을 제대로 읽었는지, 반대되는 자료를 놓치지 않았는지, 수치와 번역이 정확한지, 진료에 적용할 때 무엇을 조심해야 하는지 단계마다 따로 확인합니다. 현재는 이 방법을 실제 연구 과제로 반복 시험하는 중이며, 외부 검토를 거친 연구를 안정적으로 발행할 수 있을 때까지 결과의 상태를 분명히 표시합니다.

현재 공개할 수 있는 연구: 연구 프로토콜, 미해결 질문, 가설, 탐색적 종합입니다. 외부 동료평가를 마치기 전에는 동료평가 논문이나 최종 발행본으로 표시하지 않습니다.

Nine stages

질문에서 공개 검토까지 아홉 단계

Stage 1

먼저 질문을 분명히 씁니다

가장 가까운 선행연구, 새로 답하려는 부분, 가능한 다른 설명과 연구 중단 기준을 결과를 보기 전에 정합니다.

Stage 2

자료를 여러 방향에서 찾습니다

현대 연구와 등록 자료, 정정·철회 기록, 원전의 서로 다른 판본과 임상 기록을 각기 알맞은 방법으로 찾습니다.

Stage 3

찾기와 판단을 나눕니다

자료를 찾은 과정과 연구에 쓸 수 있다고 판단한 과정을 구분합니다. 원문 충실성, 반대 근거, 임상 적용의 주의를 서로 다른 역할이 살핍니다.

Stage 4

주장마다 근거를 연결합니다

논문의 핵심 문장이 어느 자료의 어느 구절에서 왔고, 어디부터 저자의 해석이나 가설인지 따라갈 수 있게 기록합니다.

Stage 5

자료의 성격에 맞게 평가합니다

임상시험에는 비뚤림 평가를, 고전 문헌에는 판본과 전승 맥락을, 질적 연구에는 그에 맞는 기준을 적용합니다.

Stage 6

지지와 반대를 함께 읽습니다

가설을 뒷받침하는 자료뿐 아니라 반대하거나 적용 범위를 좁히는 자료도 같은 비중으로 검토합니다.

Stage 7

분석을 다시 해볼 수 있게 합니다

분석 계획과 코드를 남기고, 처음 발견한 결과와 미리 정한 가설을 확인한 결과를 구분합니다.

Stage 8

진료에 옮길 수 있는 범위를 밝힙니다

환자에게 중요한 결과와 위해 가능성, 다시 평가해야 할 시점, 아직 임상 판단을 바꾸기에 부족한 부분을 명시합니다.

Stage 9

비평과 수정을 함께 공개합니다

검토자가 제기한 문제, 저자의 답변, 문서가 바뀐 부분과 정정 기록을 이전 버전과 함께 보존합니다.

Research tools

도구는 더 넓게 찾도록 돕고, 판단은 연구자가 책임집니다

공개 원문 찾기

Unpaywall·OpenAIRE·기관 저장소·PMC를 이용해 합법적으로 공개된 원문을 찾고, 주소와 판본, 이용 조건, 파일의 동일성을 확인할 정보를 기록합니다.

확인된 문서 안에서 묻기

검색 도구가 제시한 답변과 인용은 곧바로 근거로 쓰지 않습니다. 실제 문서의 해당 구절과 앞뒤 맥락을 연구자가 확인한 뒤에만 논문에 반영합니다.

놓친 질문 찾기

여러 관점에서 질문을 확장하는 공개 도구를 활용하되, 도구가 만든 요약문 자체를 학술 출처로 인용하지 않습니다.

Publication thresholds

평균 점수가 좋아도 중요한 오류가 있으면 발행하지 않습니다

존재하지 않는 출처는 한 건도 허용하지 않으며, 핵심 주장에는 모두 확인 가능한 원문 구절이 있어야 합니다. 수치와 고전의 위치 정보는 다른 사람이 다시 확인할 수 있어야 하고, 한국어와 영어가 임상적으로 다른 뜻을 만들어서는 안 됩니다. 외부 검토에서 제기된 중대한 문제는 해결하거나 본문에 한계로 표시합니다. 이 기준은 평균 성능뿐 아니라 언어, 연구 설계, 결론의 방향별로 가장 취약한 경우에도 적용합니다.

Calibration cadence

한 번 검사하고 끝내지 않습니다

  • 연구할 때마다 출처, 원문 구절, 수치, 중복, 철회 여부와 개인정보를 검사합니다.
  • 매월 같은 검증 자료로 모델이나 지시문 변경이 정확도를 해치지 않았는지 확인합니다.
  • 분기마다 외부 검토와 이미 발행된 주장의 무작위 재검사를 진행합니다.
  • 매년 음성 결과, 정정, 위해 신호와 편집 독립성을 함께 평가합니다.

새 모델이 더 유창하다는 이유로 교체하지 않습니다. 고정 benchmark에서 비열등성과 중요한 실패 영역의 개선을 보여야 합니다.