Herramientas
Organizadas por caso de uso. Todas las herramientas son gratuitas o tienen un plan gratuito, salvo las marcadas con 💰.
Desarrollo con Azure AI
| Herramienta | Descripción | Enlace |
|---|---|---|
| Azure AI Foundry Portal | Centro principal para crear proyectos de IA, explorar el catálogo de modelos, ejecutar evaluaciones y desplegar agentes | ai.azure.com |
Azure AI CLI (az ai) | Aprovisiona hubs, proyectos y conexiones de IA desde la línea de comandos | Docs |
| azure-ai-projects SDK | SDK unificado de Python para AI Foundry: agentes, evaluaciones y conexiones | PyPI |
| Azure AI Evaluation SDK | Ejecuta evaluaciones de calidad y seguridad sobre salidas de IA de forma programática | PyPI |
| Prompt flow | Orquestación de aplicaciones con LLM: construir, probar, evaluar y desplegar | GitHub |
| Semantic Kernel | SDK open-source para orquestar modelos de IA, plugins y memoria (Python / C# / Java) | GitHub |
| AutoGen | Framework de conversaciones multiagente de Microsoft Research | GitHub |
| Azure OpenAI Structured Outputs | response_format: {strict: true} garantiza JSON ajustado al esquema desde el LLM; úsalo con Pydantic para un parsing de intención determinista | Docs |
| Azure AI Foundry Agent Evaluators | 9 evaluadores integrados para agentes de producción: Task Completion, Task Adherence, Tool Call Accuracy, Tool Input Accuracy, Tool Selection, Tool Output Utilization, Task Navigation Efficiency, Intent Resolution y Tool Call Success | Docs |
| Azure Content Safety — Prompt Shields | Bloqueo en tiempo real de ataques de jailbreak del usuario y de prompt injection indirecto (XPIA) procedente de documentos antes de que el LLM los vea | Docs |
| Azure Content Safety — Groundedness Pro | Más estricto que groundedness estándar: usa los modelos de seguridad hospedados de Microsoft, devuelve True/False y no requiere un despliegue de LLM. Ideal para finanzas y salud | Docs |
| Azure APIM Semantic Caching | Cachea consultas semánticamente similares al LLM en el gateway para reducir costo y latencia. ⚠️ No es una herramienta de confiabilidad: la documentación advierte que puede devolver respuestas desactualizadas. Usa score-threshold="0.05" y TTLs | Docs |
| Microsoft Defender for Cloud — AI Workloads | Alertas y recomendaciones de seguridad específicas para cargas de IA: detecta prompt injection, exfiltración de datos y uso indebido en producción | Docs |
| VS Code AI Foundry Toolkit | Tracing local con OpenTelemetry para agentes de Azure AI Foundry, ideal para depurar sin depender de viajes al cloud | Docs |
Herramientas de Claude y Anthropic
| Herramienta | Descripción | Enlace |
|---|---|---|
| Claude API | API principal para messages, uso de herramientas, visión y streaming | Docs |
| Anthropic Agent SDK | Crea agentic loops, sistemas multiagente y hooks | Docs |
| Claude Code | Agente de programación impulsado por IA con configuración CLAUDE.md, comandos personalizados e integración CI/CD | Docs |
| Claude Code Hooks | Más de 25 hooks de ciclo de vida para sesiones de agentes: PreToolUse, PostToolUse, PostToolUseFailure, PostToolBatch, UserPromptSubmit, PreCompact y Stop. ⚠️ Son hooks de Claude Code (CLI), no de la Anthropic Messages API | Docs |
| Extended Thinking | budget_tokens controla la profundidad del razonamiento antes de responder; el modo adaptive (Opus 4.8+) decide por sí mismo cuándo hace falta razonamiento profundo. Úsalo en decisiones de alto impacto para detectar contradicciones antes de las tool calls | Docs |
| MCP SDK | Crea servidores de Model Context Protocol para ampliar Claude con fuentes de datos en vivo; la arquitectura adecuada para externalizar registros de conceptos de negocio, alias de entidades y resolvedores temporales | GitHub |
| Anthropic Academy | Cursos oficiales sobre agentes, prompt engineering y uso de herramientas | academy.anthropic.com |
Infraestructura y routing para LLM
| Herramienta | Descripción | Enlace |
|---|---|---|
| LiteLLM | AI Gateway open-source con soporte para 100+ LLMs: centraliza routing, aplica guardrails, retry/fallback logic, virtual keys, spend tracking y load balancing. Soporta A2A Protocol para llamadas entre agentes | GitHub |
| Azure API Management | Gateway empresarial para Azure OpenAI: rate limiting, load balancing entre múltiples endpoints, medición de tokens y semantic caching | Docs |
Red teaming y seguridad
| Herramienta | Descripción | Enlace |
|---|---|---|
| PyRIT | Python Risk Identification Toolkit de Microsoft para IA; automatiza el red teaming | GitHub |
| Garak | Escáner de vulnerabilidades para LLM: prueba jailbreaks, alucinaciones y fuga de datos | GitHub |
| PromptBench | Benchmark de robustez adversarial para LLMs | GitHub |
| Azure AI Content Safety | API para detectar contenido dañino: violencia, odio, autolesiones y contenido sexual | Portal |
| Purview AI Hub | Descubre, clasifica y gobierna el uso de IA en M365 y Azure | Docs |
| Counterfit | Herramienta de pruebas de seguridad para modelos de AI/ML | GitHub |
Evaluación y observabilidad
| Herramienta | Descripción | Enlace |
|---|---|---|
| Azure AI Foundry Evaluations | Evaluadores integrados: groundedness, coherence, fluency, relevance y safety | Docs |
| Azure AI Foundry Tracing | Tracing nativo con OpenTelemetry para agentes: spans paso a paso, tool calls, retries y costos. Exporta a Application Insights | Docs |
| RAGAS | Retrieval-Augmented Generation Assessment: faithfulness, relevancia de respuesta y context recall | GitHub |
| Promptfoo | Herramienta CLI para evaluación de LLM, red teaming y pruebas de regresión | GitHub |
| LangSmith 💰 | Observabilidad de LLM, tracing y gestión de datasets | smith.langchain.com |
| Langfuse | Observabilidad open-source para LLM: seguimiento completo de sesiones, workflows de contexto y opción self-hosted | langfuse.com |
| Arize Phoenix | Observabilidad open-source para ML y LLM: métricas de alucinación, trazabilidad de retrieval en RAG y compatibilidad nativa con OpenTelemetry | GitHub |
| Braintrust 💰 | Pipeline trace-to-eval con scorers LLM personalizados y revisión human-in-the-loop | braintrust.dev |
| Galileo 💰 | Guardrails de alucinación para producción: bloqueo inline con Luna-2 y escalabilidad al 100% del tráfico | galileo.ai |
| DeepEval | Framework open-source de evaluación con más de 50 métricas: RAG, agentes, safety y multi-turn | GitHub |
| Confident AI 💰 | Evaluación integral de agentes: task completion, calidad de razonamiento y eficiencia de costos | confident-ai.com |
| Patronus AI | Evaluación para dominios regulados: finanzas, copyright y toolkit de detección open-source | patronus.ai |
| Maxim AI 💰 | Observabilidad full-stack para agentes: simulación, depuración en tiempo real, eval loop y seguimiento de contexto | getmaxim.ai |
| AgentOps | Monitoreo ligero de agentes: 400+ frameworks, métricas de confiabilidad y replay de sesiones | agentops.ai |
| Azure Monitor | Integración de Application Insights para telemetría de cargas de IA y exportación con OpenTelemetry | Docs |
Confiabilidad agéntica y cómputo determinista
Herramientas para construir agentes de producción que sean auditables, deterministas y resistentes a la alucinación y a la degradación del contexto.
| Herramienta | Descripción | Enlace |
|---|---|---|
| tiktoken | Librería de conteo de tokens de OpenAI para medir el uso exacto de la ventana de contexto por modelo (GPT-4, GPT-4o, etc.) antes de enviar al LLM | GitHub |
| DuckDB | Base de datos OLAP embebida: ejecuta SQL sobre DataFrames, Parquet y CSVs con latencia de subsegundo. Ideal para cómputo financiero determinista en pipelines de IA | duckdb.org |
| Pydantic v2 | Cumplimiento de esquemas para salidas de LLM: define BaseModel para el JSON esperado, valida tras cada tool call y repara automáticamente salidas inválidas | docs.pydantic.dev |
| Guardrails.ai | Framework de validación de salida con rails para type checking, enforcement de formato, detección de PII y lógica de retry en salidas de LLM | guardrailsai.com |
| Instructor | Salidas estructuradas de LLM con Pydantic; fuerza a modelos de OpenAI / Anthropic a devolver objetos tipados válidos | GitHub |
| LangChain ConversationTokenBufferMemory | Recorte de memoria consciente de tokens: poda automáticamente el historial de conversación para mantenerse dentro del presupuesto de contexto | Docs |
| MLflow | Seguimiento de experimentos, versionado de modelos y pipelines de evaluación; registra ejecuciones deterministas de agentes con linaje completo de parámetros | mlflow.org |
| Opik (Comet) | Plataforma open-source de evaluación de LLM con guardrails en tiempo real para pruebas de regresión y detección de prompt injection | comet.com/opik |
| Prefect | Orquestación de workflows para pipelines deterministas de IA: run IDs, políticas de retry y logs completos de ejecución | prefect.io |
| Great Expectations | Framework de validación de datos para afirmar contratos de datos antes de alimentar un LLM con datos financieros | greatexpectations.io |
Infraestructura y despliegue
| Herramienta | Descripción | Enlace |
|---|---|---|
| Azure Bicep | IaC para hubs de AI Foundry, proyectos y private endpoints | Docs |
| Terraform Azure Provider | Aprovisiona infraestructura de IA con HCL | Registry |
| Azure Developer CLI (azd) | Flujo de trabajo end-to-end para desarrolladores: aprovisionar y desplegar apps de IA | Docs |
| GitHub Actions | CI/CD para evaluación de modelos de IA, pipelines de fine-tuning y despliegue de aplicaciones | Docs |
| Azure Container Apps | Hosting serverless de contenedores para microservicios y agentes de IA | Docs |
Productividad y desarrollo
| Herramienta | Descripción | Enlace |
|---|---|---|
| VS Code + AI Toolkit | Playground de modelos de Azure AI, fine-tuning y despliegue desde VS Code | Marketplace |
| GitHub Copilot | Programador en pareja impulsado por IA para código, documentación y generación de pruebas | github.com/features/copilot |
| REST Client (VS Code) | Prueba llamadas API inline en archivos .http | Marketplace |
| Bruno | Cliente API open-source (alternativa a Postman, amigable con git) | usebruno.com |
| draw.io | Diagramación gratuita para diseños de arquitectura | app.diagrams.net |
Sugiere una herramienta
¿Falta algo útil? Abre un issue o escribe a lesalgad@microsoft.com.