画像からプロンプトへ。文字起こしではありません
「画像からテキスト」と言うと、普通はOCRを指します。レシートにスキャナーを向けて文字を取り出す、あれです。ここは違います。この画像からテキストAIは一枚の画像を読み、そこから新しいもの——生成モデルが実行できる記述——を書きます。画像から文字をコピーしているのではなく、その画像についてのプロンプトを書いているのです。
だからここで画像をプロンプトにすると、返ってくるのはこんな一文です。「ローアングルのポートレート、赤いレインコートの女性、夜のネオンの街路、浅い被写界深度、35mm、シネマティックなティール&オレンジのグレーディング」。この一文こそが製品そのもの——無料で使える画像からプロンプトへのジェネレーターが、あなたに語彙を返します。
以降のページでも同じです。ここで画像からテキストと言うとき、それは画像からプロンプトを意味します。請求書やスクリーンショット、手書きの文字そのものが必要なら、OCRツールが正解であり、ImagineImage.io はその役目ではありません。
| 項目 | 画像からプロンプト(このページ) | OCR/文字起こし |
|---|---|---|
| 返ってくるもの | その画像を説明したプロンプト | 画像に印字されている文字そのもの |
| 読み取る対象 | 被写体、スタイル、光、レンズ、雰囲気 | 文字の形とレイアウト |
| 向いている用途 | 見た目を再現・アレンジする | 書類やレシートをデータ化する |
| 次の一手 | プロンプトを生成ツールに貼る | テキストを文書に貼る |
AI画像からテキストのジェネレーターが実際に読んでいるもの
画像からプロンプトAIは、検索エンジンのように画像を「認識」するのではなく、画像を描写します。ビジョンモデルが生成ツールにとって意味のある観点で見えたものを報告し、画像からテキストのジェネレーターがそれをタグの羅列ではなく、そのまま使える一段落に組み立てます。
この組み立てこそ、最も過小評価されている工程です。「女性、街、夜、雨」といったラベルの山からは何も再現できません。プロンプトには順序と重みがあります。被写体は何か、どう切り取られているか、光が何をしているか、どの媒体やカメラに見えるか、そして全体がどう感じられるか。プロンプトのために作られた画像からテキストAIが、アクセシビリティ用のキャプションモデルとまったく違う読み味になるのはそのためです。
以下が、一度の画像からテキストの実行で画面から取り出される要素です。好きな画像を六枚ほど通せば、良いプロンプトの形はもう謎ではなくなります。
被写体
画面に誰が・何がいて、何をしているか。
構図
切り取り方、角度、距離、そして被写体の背後にあるもの。
スタイルと媒体
写真、3Dレンダー、油彩、アニメ、エディトリアルイラスト。
ライティング
方向・硬さ・色。ゴールデンアワー、硬いフラッシュ、ネオンの回り込み。
カメラとレンズ
見た目の焦点距離、被写界深度、パース。
色と雰囲気
パレット、グレーディング、空気感——「似ている」と感じさせる部分。
画像をテキストに変換する三つの理由
文章そのものが欲しくて画像からテキストを使う人はいません。作りたいのは絵で、言葉はそこへの道です。
見つけた画像の作り方が知りたい
タイムラインで手が止まる一枚——色の調子、光の作り、名前のつけられないスタイル。自力で当てにいけば一時間、写真からテキストAIならワンクリックです。返ってくるプロンプトには、自分が持っていなかった語彙が並びます。リムライト、85mmの圧縮感、彩度を落としたアナログ調。生成ツールを探すよりずっと前に「画像からプロンプトを抽出」と検索する人が多いのはこのためです。
例雰囲気のある物撮り →「濡れたスレート上のマットな陶器のマグ、カメラ左からの硬いキーライト、クールなグレーの色調」。
画像から画像への出発点が欲しい
このツールが本来想定しているワークフローです。まず画像をテキストに変換し、プロンプトを読み、変えたい一節だけ——季節、服装、媒体——を書き換えて、元画像と編集後のプロンプトを一緒に画像から画像へ送ります。運任せではなく、制御された派生が手に入ります。
例「…秋の公園、暖かい光…」→ 三語だけ変更 →「…雪の積もった公園、冬のフラットな光…」。
シリーズ全体のトーンを揃えたい
一枚だけ決まって、あとが揃わない。うまくいった一枚を画像からテキストのジェネレーターに通し、返ってきたプロンプトをテンプレートとして保存して、新しい素材ごとに被写体の一節だけ差し替えます。失った作業の救出にも効きます。画像は保存したのにプロンプトを残していなかったとき、戻る道はこれだけです。
例「柔らかいスタジオ光、シームレスなグレー背景、50mm」を固定し、毎回プロダクトだけ差し替える。
画像をプロンプトに変換する4ステップ
画像をアップロード
JPG、PNG、WebP。小さなスクリーンショットより、シャープで切り抜かれていない元画像のほうが正確に描写されます。モデルは見えるものしか言えません。
画像からテキストを実行
ワンクリック。ビジョンモデルが画面全体を読み、被写体・構図・スタイル・光・色をまとめた一段落のプロンプトを書きます。
一節だけ書き換える
返ってきたプロンプトは下書きであって結論ではありません。引き継ぎたくない部分を削り、一度に一つだけ変えてください。
生成ツールに貼る
元画像を添えて画像から画像へ送れば元に近い結果に、テキストから画像へ単体で貼れば同じ作風の新しい一枚になります。
プロンプトが手元にある? そのまま画像から画像へ
画像からテキストと画像から画像は、ひとつのループの前半と後半です。前半は一枚の絵の裏にある言葉を渡し、後半はその言葉を再び絵に戻します。下にあるスタジオがその後半です。抽出したプロンプトを貼り、元画像を添えて実行してください。
画像から画像の完全ガイドを読む →1ファイルあたり最大10MB
例
パラメータを設定して「生成」をクリックしてください

Reference Restyle
Transform a reference image into a polished alternate style while preserving the subject.

Scene Enhancement
Enhance a source image with richer lighting, color, and cinematic detail.

Creative Variation
Create a strong visual variation from an input image and editing prompt.

Portrait Restyle
Restyle a vertical portrait into a sharper illustrative direction while keeping character identity.

Fantasy Edit
Transform a character reference into a detailed fantasy key visual.

Hero Fusion Edit
Turn a character reference into a glowing mythic hero portrait with cloud-like energy.

Anime Scene Edit
Transform a reference into a cinematic anime frame with expressive lighting and bloom.
画像からテキストが苦手なこと
この種のツールはどれも自分を大きく見せます。ここに挙げるのは実際にぶつかる失敗と、その対処法です。
画像内の文字は読み取りません
いちばん多い落胆なので二度書きます。看板、パッケージの文言、手書き文字は文字起こしされません。文字があること、どんな見た目かは描写しますが、何と書いてあるかは返しません。
対処法紙面の文字そのものが必要ならOCRツールを。目的が違えば製品も違います。
プロンプトで元画像を完全再現はできません
どんなプロンプトでも不可能です。元画像は特定のモデル・シード・設定から生まれており、言葉はその全部を欠落なく運べません。同じ雰囲気は得られますが、同じピクセルは得られません。
対処法元画像を添えて画像から画像を実行してください。言葉には決してできない形で構図を固定できます。
顔や固有名詞は一般化されます
特定の人物、ブランド商品、著作権のあるキャラクターは、名前ではなく「短い黒髪の男性」のような一般的な表現になります。これは意図的な仕様です。
対処法利用する権利があるなら、生成ツール側で自分で固有名を足してください。
ぼやけた小さい画像からは曖昧なプロンプトしか出ません
この画像からテキストのジェネレーターは、解像できたものしか描写しません。200pxの圧縮サムネイルからは、そのファイルと同じくらい薄いプロンプトが返ります。
対処法画像をテキストに変換する前に、手元でいちばん大きく綺麗な版をアップロードしてください。
画像からテキストは無料・オンライン・登録不要
画像からテキストが無料と謳うツールの多くは、三回試したら四回目で有料の壁、という意味です。ここはブラウザ上で動く本当のオンライン画像からテキストです。毎日の無料実行枠、インストール不要、最初の数回は登録なしの画像からテキスト。アカウントが要るのは履歴の保存と上限アップのときだけです。
これが効いてくるのは、プロンプトの逆算がゴールではないからです。同じ画像を二度回し、一節を直し、別の参考画像と見比べ、そのうえで結果を生成ツールへ持っていく。プロンプトの出来を確かめる前に課金を求めるツールは、一度きりで使われなくなります。
ImagineImage.io の他の機能——画像から画像、テキストから画像、動画——も同じ無料デイリークレジットを使うので、ここで抽出したプロンプトはそのまま生成に回せます。
毎日の無料枠
クレジットは毎日回復し、画像からテキストにも画像生成にも使えます。
登録なしで開始
アカウントを作る前に画像をテキストに変換できます。
ブラウザで動作
完全オンライン。インストールも拡張機能も不要、スマホでも動きます。
プロンプトはあなたのもの
どこにでもコピーできます。当スタジオでも、すでに課金している他の生成ツールでも。
画像からテキストAI よくある質問
これはOCR/文字起こしですか?
どちらでもありません。画像からプロンプトへのツールです。OCRはスキャンから印字された文字を読み取りますが、こちらは画像を読み、画像生成ツールが使える記述を書きます。書類を上げて文字を期待したなら道具違いです。写真を上げて「こういう絵の作り方」を知りたいなら、まさにここです。
画像をプロンプトに変換するにはどうすればいいですか?
画像をアップロードして、返ってきたプロンプトを読むだけです。被写体・構図・スタイル・光・色をまとめた一段落が届きます。変えたい部分を編集し、元画像を添えて画像から画像へ、または単体でテキストから画像へ貼り付けてください。
画像からテキストは無料ですか?
はい。毎日の無料枠でまかなえ、コピーした内容に透かしは入らず、アカウントなしで始められます。有料プランが増やすのは出力の質ではなく、回数と履歴です。
登録不要で画像からテキストを使えますか?
はい、登録不要が既定です。抽出したプロンプトを保存したい場合や、上限を上げたい場合だけログインしてください。
スマホで撮った写真でも写真からテキストAIとして使えますか?
使えます。写真、スクリーンショット、レンダー、イラストのいずれも対応します。アップロードが大きく鮮明なほど、返るプロンプトは具体的になります。
プロンプトで元の画像をそのまま再現できますか?
できません。他のどのツールでも同じです。元画像は特定のモデル・シード・設定から生まれており、言葉はそれを完全には運べないため、得られるのは雰囲気の一致です。より近づけたいなら、元画像を画像から画像に添えて、文章ではなく画像に構図を決めさせてください。
使い回せるプロンプトにするには?
抽出したプロンプトから、その一枚に固有の記述を削り、光・媒体・グレーディングの記述を残します。残ったものがスタイルのテンプレートです。素材ごとに被写体の行だけ差し替えれば、シリーズの見た目が揃います。
無料で無制限の画像からプロンプト生成はありますか?
無料はあります、無制限はありません。デイリークレジットは毎日リセットされ、ヘビーな使い方にはプランが必要です。本当に無制限で無料と謳うサービスは、静かに速度制限をかけているか、出力に透かしを入れています。
自分が作っていない画像からプロンプトを抽出してもいいですか?
技術的には可能で、実際いちばん多い使い方です。光や構図から学ぶのは正当ですが、著作権のあるキャラクターや実在の人物の見た目を再現するのは別問題です。
対応するフォーマットとサイズは?
JPG、PNG、WebPで最大10MBです。手元でいちばん大きく綺麗な版をアップロードしてください。モデルは解像できたものしか描写できません。
画像キャプションツールとの違いは?
キャプションは読み手のために書かれます。短く、字義どおりで、アクセシビリティ向けです。プロンプトはモデルのために書かれ、順序と重みがあり、焦点距離やキーライト、グレーディングといった制作用語で満たされています。このAI画像からテキストのツールが書くのは後者です。
画像からテキストを経由して動画まで行けますか?
行けます。プロンプトを抽出し、動きの一節——カメラワークやアクション——を足して動画生成に使ってください。スタイルの言語はそのまま移りますが、動きの部分は自分で書く必要があります。