Research
On-device research index

arXiv research

A locally-built, LLM-digested index of recent arXiv papers in quant finance, geometry/topology, and statistical ML — keyword search served straight from SQLite on this machine.

169,051 papers · 148 categories

Trend · papers per month

3957911,1861,581 · Jun 202019922001200920182026
48 results for data optimization

This paper reviews data-driven optimization techniques for decision-making under uncertainty.

problem Decision-making under uncertainty in the era of big data and deep learning.
method Comprehensive review of data-driven distributionally robust optimization, chance constrained program, robust optimization, and scenario-based optimization.
result Identification of potential research opportunities in closed-loop data-driven optimization and scenario-based optimization leveraging deep learning.

Study optimal product assortment using historical data, proving item coverage suffices.

problem Offline assortment optimization under MNL model with limited historical data.
method Pessimistic Rank-Breaking (PRB) algorithm combining rank-breaking and pessimistic estimation.
result Optimal item coverage is both sufficient and necessary for efficient offline learning.

Topological Bayesian Optimization finds optimal structures using topological data.

problem Optimizing complex structured data like material or neural network structures.
method Extract topological information from structures using persistent homology, apply Bayesian optimization with kernels for persistence diagrams.
result Topological information improves search efficiency for optimal structures.

New algorithm guarantees optimal convergence rate for stochastic optimization.

problem Optimal convergence rate for stochastic optimization algorithms.
method Regularized versions of Minimization by Incremental Surrogate Optimization (MISO) with arbitrary recurrent data sampling.
result Expected optimality gap converges at O(n1/2)O(n^{-1/2}) under general recurrent sampling schemes.

Bayesian optimization method tackles combinatorial spaces, scalable for large data.

problem Optimization over combinatorial categorical spaces in natural sciences.
method Combines variational optimization and continuous relaxations for gradient-based optimization.
result Method performs comparably to state-of-the-art methods while scaling well.

Optimizes decisions without knowing the true distribution using historical data.

problem Optimizing decisions without knowing the true distribution.
method Combines sampling and bisection search algorithms to solve an optimization problem.
result Proves sufficient conditions for local out-of-sample optimality.

Optimal DP model training with public data improves privacy and accuracy.

problem Ensuring privacy while training models with public data.
method Proves optimal error rates for DP model training with public data, develops novel algorithms.
result Optimal error rates can be achieved by using public data or optimal DP algorithms.

RFMS optimizes model hyperparameters across remote sites for high-dimensional data.

problem Training machine learning models on remote data sites due to privacy and trust concerns.
method Bayesian Optimization for multi-objective hyperparameter tuning.
result Multi-objective Bayesian Optimization improves model performance across multiple data sites.

Proposes data-driven methods for estimating conditional expectations.

problem Estimating conditional expectations when underlying density is unknown.
method Data-driven techniques to directly estimate conditional expectations from training data.
result Extends data-driven method to solve nonlinear equations in stochastic optimization.

Automatically learns optimal data augmentation for image classification.

problem Finding optimal data augmentation hyperparameters is computationally demanding and requires domain knowledge.
method Proposes an online bilevel optimization framework to learn data augmentation parameters directly.
result Jointly trained method achieves comparable or better classification accuracy than hand-crafted data augmentation without an external validation loop.

HOIST uses multiple surrogates to optimize DNN hyperparameters efficiently.

problem Insufficient evaluation data for Bayesian optimization of DNN hyperparameters.
method HOIST combines complete and intermediate evaluation data using weighted bagging of multiple surrogates.
result HOIST outperforms state-of-the-art approaches on various DNN types.

Paper relaxes optimal transport using convex functions for data science.

problem Optimal transport problem on finite spaces.
method Relaxation via strictly convex functions (Kullback-Leibler divergence, Bregman divergences). Gradient descent iterative process.
result Mathematical foundations and iterative process for the relaxed optimal transport problem.

MINs learn inverse mappings for high-dimensional optimization problems.

problem Data-driven optimization with high-dimensional inputs and valid subsets.
method Model Inversion Networks (MINs) learn an inverse mapping from scores to inputs.
result MINs can scale to high-dimensional input spaces and handle both offline and active data.

Framework optimizes portfolios using big data from financial markets.

problem Optimizing investment decisions with structured and unstructured financial data.
method 5-stage methodology including DEA, text mining, clustering, ranking, and heuristics for portfolio optimization.
result Helps investors select, weight, and manage assets for informed investment decisions.

New method optimizes data from correlated time series using robust optimization.

problem Optimizing with non-i.i.d. vector autoregressive data.
method Distributionally robust optimization with Wasserstein distance.
result Method is equivalent to a convex-concave saddle point problem.

Ringleader ASGD optimizes SGD for diverse edge devices with varying data and computation speeds.

problem Scalable distributed optimization with heterogeneous devices and data.
method Ringleader ASGD, an asynchronous SGD algorithm.
result Achieves optimal time complexity under data heterogeneity and arbitrary computation speeds.

Paper proposes a method to predict optimal data partitioning based on query execution costs.

problem Finding optimal data partitioning for improved system performance and scalability.
method Formal model abstraction of workload queries, genetic algorithm for optimization, evaluation using PostgreSQL's query optimizer.
result The approach effectively reduces workload execution cost and improves system performance.

Study examines how data augmentation impacts optimization in linear regression.

problem Understanding how data augmentation schedules affect optimization in linear regression.
method Analyzed the effect of augmentation on optimization in linear regression with MSE loss, using classical convex optimization and recent work on implicit bias.
result Proved that under certain joint schedules for learning rate and augmentation scheme, augmented gradient descent converges and characterized the resulting minimum.

Optimal contracts help principals delegate data collection in decentralized ML.

problem Dealing with information asymmetries in decentralized ML.
method Design of optimal and near-optimal contracts addressing uncertainty in model quality and performance.
result Simple linear contracts achieve 1-1/e fraction of optimal utility.

A new framework for optimizing interventions with limited data.

problem Small data, default intervention data, unmodeled objectives, unforeseen consequences.
method Bandit data-driven optimization combining online bandit learning and offline predictive analytics.
result PROOF algorithm achieves no-regret and superior performance in simulations and real-world application.

Optimizes weights for better model performance in shifting data.

problem Improper importance weighting leads to poor model performance in data shifts.
method Interprets weights as a bias-variance trade-off and optimizes them simultaneously with model parameters.
result Optimizing weights significantly improves model generalization performance.

A new framework optimizes manufacturing decisions with less data and time.

problem Optimizing complex systems with multiple conflicting objectives.
method Data-driven Bayesian optimization using sequential learning.
result The proposed algorithm achieves the actual Pareto front with less data.

BL learns interpretable optimization structures from data.

problem Learning interpretable optimization structures from data.
method BL parameterizes a compositional utility function from intrinsically interpretable modular blocks.
result BL supports architectures from single to hierarchical compositions, modeling hierarchical optimization structures.

A novel Federated Learning scheme using Optimal Transport for personalized model training.

problem Training models with data from clients having non-identically distributed data.
method Personalized Federated Learning scheme based on Optimal Transport (FedOT).
result FedOT scheme effectively transfers data from multiple distributions to a common domain and optimizes the prediction model.

COT-GAN generates sequential data with a causal optimal transport approach.

problem Generating sequential data with temporal causality constraints.
method Adversarial training with Causal Optimal Transport (COT) and entropic penalization.
result COT-GAN effectively learns time-dependent data distributions and generates stable time series data.

Optimal LDP mechanisms reduce data unfairness in classification.

problem Reducing data unfairness in classification models.
method Developed a closed-form optimal mechanism for binary attributes and a tractable framework for multi-valued attributes.
result Optimal LDP mechanisms improve fairness in classification while maintaining accuracy close to non-private models.

A novel decentralized algorithm improves minimax optimization in federated learning.

problem Minimax optimization in federated learning with data heterogeneity.
method Decentralized Gradient Tracking (K-GT-Minimax) for nonconvex-strongly-concave optimization.
result Demonstrates superior convergence rate for NC-SC minimax optimization.

Paper optimizes WGAN parameters for non-Gaussian data.

problem Optimizing parameters for non-Gaussian data in WGAN.
method Characterization of optimal solutions for population WGAN beyond LQG setting, using sliced Wasserstein framework.
result Closed-form optimal parameters for non-linear activation functions and non-Gaussian data derived.

Improved convergence for nonconvex optimization with dependent data.

problem Constrained smooth nonconvex optimization with dependent data.
method Stochastic projected gradient methods under a general dependent data sampling scheme.
result Achieved worst-case rate of convergence ildeO(t1/4) ilde{O}(t^{-1/4}) and complexity ildeO(ε4) ilde{O}(\varepsilon^{-4}).

Proposes robust assortment optimization from observational data.

problem Real-world scenarios often violate assumptions of stable customer preferences and correct choice models.
method Develops a robust framework that accounts for potential distributional shifts in customer choice behavior.
result Uncovered the notion of ``robust item-wise coverage'' as the minimal data requirement for sample-efficient robust assortment learning.