{"model":{"id":"caption-pro","name":"Caption Pro","description":"Larger vision-language model. Accurate VQA, OCR, and detailed image analysis when fidelity matters more than speed.","tasks":["vqa","ocr","caption"],"credits_per_call":3,"input_fields":{"image_url":"string (required)","prompt":"string (required)"},"output_fields":{"output":"string"},"api_gross_margin_percent":20,"schema_url":"/api/v1/vision?model_id=caption-pro","input_schema":{"$schema":"https://json-schema.org/draft/2020-12/schema","$id":"https://www.artemotion.ai/api/v1/vision?model_id=caption-pro","title":"Caption Pro request","type":"object","properties":{"model_id":{"type":"string","const":"caption-pro"},"webhook_url":{"type":"string","format":"uri","maxLength":2048},"webhook_secret":{"type":"string","maxLength":512},"image_url":{"type":"string","format":"uri"},"prompt":{"type":"string"},"question":{"type":"string"}},"required":["model_id","image_url"],"anyOf":[{"required":["prompt"]},{"required":["question"]}],"additionalProperties":false}},"version":"1","rate_limit":"20 req/min"}