این مستند با هدف راهنمایی گامبهگام مهندسان و توسعهدهندگان برای انتخاب، دانلود و اجرای بهینهترین مدلهای بینایی-زبانی (Vision-Language) با فرمت GGUF جهت انجام عملیات OCR (بازشناسی نوری کاراکتر) روی اسناد چندزبانه با استفاده از ابزار Ollama تهیه شده است.
بر اساس جستوجوهای تخصصی در پلتفرم Hugging Face، مدلهای زیر بهترین عملکرد را برای OCR چندزبانه در قالب GGUF و با سازگاری کامل با Ollama ارائه میدهند:
مدل Qwen2.5-VL قابلیتهای OCR خود را به سطح جدیدی ارتقا داده و از پشتیبانی چندزبانه، چندسناریویی و تشخیص متن در جهتهای مختلف برخوردار است [[34]]. این مدل توسط تیم Qwen در Alibaba Cloud توسعه یافته و سازگاری عالی با Ollama دارد [[30]].
این مدل بهطور خاص برای انجام OCR با توکنهای کارآمد طراحی شده و متنهای چاپی و دستنویس را در زبانهای اصلی شناسایی میکند [[1]]. نسخه GGUF این مدل (مانند NexaAI/DeepSeek-OCR-GGUF) برای استنتاج محلی بهینهسازی شده است [[4]].
یک مدل بینایی-زبانی 3 میلیارد پارامتری که بر پایه DeepSeek-OCR ساخته شده و عملکرد آن را در وظایف تخصصی OCR ارتقا میدهد [[2]].
ترمینال یا خط فرمان خود را باز کرده و دستور زیر را اجرا کنید. این دستور بهطور خودکار مدل را دانلود و محیط تعاملی را راهاندازی میکند:
ollama run qwen2.5vl
برای استفاده از نسخه سبکتر و سریعتر، میتوانید از دستور ollama run qwen2.5vl:3b استفاده نمایید.
اگر میخواهید از نسخههای خاص کوانتایز شده (مانند unsloth/Qwen2.5-VL-7B-Instruct-GGUF) استفاده کنید، مراحل زیر را دنبال کنید:
Q4_K_M) را از Hugging Face دانلود کنید.Modelfile (بدون پسوند) ایجاد کنید.Modelfile را به صورت زیر تنظیم کنید:FROM ./Qwen2.5-VL-7B-Instruct-Q4_K_M.gguf
TEMPLATE """{{ if .System }}<|im_start|>system
{{ .System }}<|im_end|>
{{ end }}<|im_start|>user
{{ .Prompt }}<|im_end|>
<|im_start|>assistant
"""
SYSTEM "شما یک دستیار هوشمند و متخصص در استخراج دقیق متن از تصاویر و اسناد چندزبانه هستید. فقط متن موجود در تصویر را بدون توضیح اضافی بازگردانید."
PARAMETER temperature 0.1
ollama create qwen2.5vl-ocr-custom -f Modelfile
ollama run qwen2.5vl-ocr-custom
پس از اجرای مدل در محیط تعاملی Ollama، میتوانید مسیر محلی تصویر یا سند خود را وارد کرده و درخواست استخراج متن کنید. مثال:
/path/to/your/document.jpg
لطفاً تمام متن موجود در این تصویر را به دقت استخراج کن و به زبان فارسی خروجی بده.
Q4_K_M یا Q5_K_M استفاده کنید که تعادل عالی بین دقت و سرعت ارائه میدهند.temperature را در Modelfile روی مقادیر پایین (مانند 0.1 یا 0.2) تنظیم کنید تا مدل خلاقیت کمتر و وفاداری بیشتری به متن اصلی تصویر داشته باشد.