2026.08.08
自分のOSSを複数のAIにレビューさせたら何が起きたか
Cross-Model Validation of prompt-as-code v0.4.0
prompt-as-code を Claude Opus 5 と GPT-5.6 Sol に独立レビューさせ、突き合わせた。過大表現の発見、帰属の誤り、パターン有効性の検証——そしてスコープ判断は人間にしかできないという結論。
読むNotes — 研究ノート
プロンプトレビューの現場で得た知見、prompt-as-code の仕様を変えた理由、CriticChain のチューニングログ——ラボの仕事のそばで書かれた、短い文章を置いていきます。
2026.08.08
Cross-Model Validation of prompt-as-code v0.4.0
prompt-as-code を Claude Opus 5 と GPT-5.6 Sol に独立レビューさせ、突き合わせた。過大表現の発見、帰属の誤り、パターン有効性の検証——そしてスコープ判断は人間にしかできないという結論。
読む2026.08.07
What the Context Engineering Discussion Is Missing
プロンプトエンジニアリングからコンテキストエンジニアリングへ——用語の転換は進んだ。しかし業界の議論はランタイムの最適化に集中しており、管理すべきコンテキストを「作る」プロセスは体系化されていない。ドキュメントファースト開発の現場から。
読む2026.07.04
Marketing vs. Reality — Reasoning, Self-verification, and the Stripe Case
Fable 5 は「最強の汎用モデル」ではない。情報源の信頼性評価の欠如、論理的一貫性の維持の困難、ツール未活用、防衛的応答——調査の組み立て方そのものに構造的弱点を確認。Stripe 5,000 万行事例の構造分析。検証対話ログ全文公開。
読む2026.04.25
What an AI Design Tool Can and Cannot Do
Anthropic の Claude Design で 1stpiece.io を全面リデザインした記録。世界観の構築と CSS 設計には強いが、編集的な声と「引く」判断は人間の仕事だった。Before/After 比較あり。
読む