Agent Reasoning Frameworks
CoT, ToT, ReAct는 모두 "에이전트가 어떤 방식으로 생각하고 행동할지 결정하는 패턴"으로 묶인다.[1] 셋 중 environment와 상호작용하는 것은 ReAct뿐이라는 대비, 즉 CoT와 ToT는 model 내부 reasoning search를 구조화하고 ReAct는 reasoning을 external action과 observation 사이에 배치한다는 구분은 이 페이지의 해석이다. 셋 모두 memory, authorization, safety, evaluation을 자동으로 제공하지는 않는다는 점도 소스가 직접 말하지 않은 이 페이지의 해석이다.
구조 비교
| 기준 | CoT | ToT | ReAct |
|---|---|---|---|
| 구조 | 단계적 추론 과정을 명시적으로 생성[1:1] | CoT를 트리 구조로 확장해 여러 경로를 평가[1:2] | Thought-Action-Observation 반복[1:3] |
| environment | 필수 아님 | 필수 아님 | 핵심 |
| 적합 | 도구 호출 없이 모델 내부 추론만으로 처리할 때[1:4] | 복잡한 계획 수립, 창의적 문제 해결[1:5] | 정보 검색, 다단계 작업[1:6] |
| 비용 | error propagation | 단순 작업에는 과도한 계산 비용[1:7], branch explosion | tool latency와 noise |
비용 행에서 소스가 직접 말하는 것은 ToT의 "계산 비용이 높아 단순 작업에는 과도함"뿐이며,[1:8] CoT의 error propagation, ToT의 branch explosion, ReAct의 tool latency와 noise는 이 페이지의 해석이다.
- CoT는 "단일 LLM 호출 내에서 추론 품질을 높이는 기법"이고, ReAct는 "여러 번의 행동-관찰 루프 전체를 구조화하는 프레임워크"라는 점에서 서로 다른 층위에 있다.[1:9]
- ReAct paper의 Figure 1은 Standard prompting, CoT, Act-only, ReAct를 별도 방식으로 분리해 제시한다.[2] 이 구분이 있다는 것은 ReAct가 단순히 CoT를 길게 늘린 것이 아니라는 근거로 읽힌다.
- Knowledge task에서는 internal reasoning의 장점과 external acquisition의 장점이 서로 다르며, 둘을 결합하는 방식이 유리해지는 조건이 있었다는 것이 ReAct paper의 실험 결과다.[2:1]
- Benchmark 수치는 특정 model, prompt, environment 조합에 묶인 결과이며 production 환경에서의 보장이 아니다.[3]
실패 분류
| 문제 | 의미 | 함의 |
|---|---|---|
| Hallucination | 내부 지식을 사실처럼 생성 | external verification |
| Reasoning error | 중간 결론 전파 | correction point |
| Search failure | evidence 탐색 실패 | query reformulation |
| Action failure | 무효 environment action | validation과 recovery |
| Stale label | dataset와 current fact 충돌 | provenance 분리 |
이 표의 "함의" 열은 세 framework의 정의로부터 이 페이지가 도출한 대응 방향이며, 소스가 직접 제시한 목록은 아니다.
선택 조건
- External action이 필요 없고 선형 단계면 CoT가 단순하다.
- 여러 전략과 backtracking이 필요하고 evaluator가 있으면 ToT가 맞다.
- Observation에 따라 다음 action이 달라지면 ReAct가 맞다.
- Branch가 고정된 deterministic task면 predefined workflow가 더 예측 가능하다.
자주 헷갈리는 지점
- Reasoning trace가 있다고 agent가 되는 것은 아니다.
- ReAct가 safe execution을 보장하지 않는다.
- Toolformer는 inference reasoning framework가 아니라 training method다 — Toolformer 참고.
- 운영에서는 hidden reasoning 전체보다 action record와 observation provenance가 중요할 수 있다는 것은 이 페이지의 해석이다.
테스트 질문
- ReAct가 CoT의 단순 확장이 아닌 이유는 무엇인가?
- ToT search와 ReAct feedback은 어떻게 다른가?
관련
출처
Agent Architecture.md (추론 프레임워크 절) — "에이전트가 어떤 방식으로 생각하고 행동할지 결정하는 패턴." (L45), "CoT는 단일 LLM 호출 내에서 추론 품질을 높이는 기법. ReAct는 여러 번의 행동-관찰 루프 전체를 구조화하는 프레임워크.", ToT: "CoT를 트리 구조로 확장: 한 번에 여러 추론 경로를 탐색", "복잡한 계획 수립, 창의적 문제 해결에 적합", "계산 비용이 높아 단순 작업에는 과도함", 비교표: "CoT | 선형 단계적 추론 | 수학 풀이, 논리 추론", "ReAct | 추론 + 도구 호출 루프 | 정보 검색, 다단계 작업", "ToT | 다중 경로 탐색 | 복잡한 계획, 창의적 문제" ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎
ReAct_2210.03629.pdf (Figure 1, HotpotQA/FEVER 실험) — 이 PDF는 이번 변환 세션에서 poppler 부재로 재추출하지 못했고, 2026-07-11 conformance 기록 시점에 검증된 기존 claim을 그대로 유지한다. ↩︎ ↩︎
출처 매핑 미확인 — "benchmark 수치는 production 보장이 아니다"라는 일반화된 caveat이 ReAct paper 본문의 어느 문장에 대응하는지 이번 세션에서 재확인하지 못했다. PDF를 poppler로 재추출한 뒤 확인할 것. ↩︎